۱. مقدمه و تاریخچه هوش مصنوعی
هوش مصنوعی (Artificial Intelligence) دیگر تنها مفهومی در فیلم‌های علمی-تخیلی نیست، بلکه به بخشی جدایی‌ناپذیر از زندگی بشر تبدیل شده است. ریشه‌های شکل‌گیری هوش مصنوعی به دهه ۱۹۵۰ میلادی بازمی‌گردد؛ زمانی که دانشمندان برجسته‌ای مانند آلن تورینگ (Alan Turing) این سوال بنیادین را مطرح کردند که «آیا ماشین‌ها می‌توانند فکر کنند؟».
دهه ۱۹۵۰ تا ۱۹۶۰ (تولد و خوش‌بینی اولیه): این دوره با ابداع اصطلاح «هوش مصنوعی» در کنفرانس دارتموث (۱۹۵۶) و ساخت برنامه‌های ساده حل مسئله آغاز شد. محققان بسیار خوش‌بین بودند که ماشین‌ها به زودی در تمامی زمینه‌ها از انسان پیشی خواهند گرفت.
دهه ۱۹۷۰ تا ۱۹۸۰ (زمستان‌های هوش مصنوعی): به دلیل محدودیت‌های سخت‌افزاری، کمبود بودجه و پیچیدگی‌های محاسباتی، انتظارات برآورده نشد و پروژه‌ها با رکود مواجه شدند که به این دوران «زمستان هوش مصنوعی» می‌گویند. در همین دوران، سیستم‌های خبره (Expert Systems) بر پایه قوانین از پیش نوشته شده ظاهر شدند.
دهه ۱۹۹۰ تا ۲۰۱۰ (رشد داده‌ها و قدرت پردازشی): با افزایش قدرت پردازنده‌ها (CPU و بعدتر GPU) و ظهور کلان‌داده‌ها (Big Data)، الگوریتم‌های یادگیری ماشین (Machine Learning) توسعه یافتند. در سال ۱۹۹۷، کامپیوتر دیپ بلو (Deep Blue) شرکت IBM توانست قهرمان شطرنج جهان را شکست دهد.
سال ۲۰۱۰ به بعد (انقلاب یادگیری عمیق و هوش مصنوعی مولد): با ظهور شبکه‌های عصبی عمیق (Deep Learning)، شبکه‌های مولد مخاصم (GANها) و مدل‌های ترنسفورمر، تحولی عظیم رخ داد. امروزه هوش مصنوعی از مرحله تحلیل داده عبور کرده و وارد فاز خلاقیت (تولید متن، تصویر، صدا و ویدیو) شده است.
۲. انواع هوش مصنوعی در زمینه تولید تصویر و ویدیو
امروزه ابزارهای مولد (Generative AI) می‌توانند با دریافت دستورات متنی (Prompt)، تصاویری خیره‌کننده و ویدیوهایی واقع‌گرایانه خلق کنند. این ابزارها بر اساس نوع خروجی به دسته‌های زیر تقسیم می‌شوند:
ابزارهای تولید تصویر (Text-to-Image): این سیستم‌ها با استفاده از مدل‌های انتشار (Diffusion Models) آموزش دیده‌اند تا نویز تصادفی را به تصاویر باکیفیت تبدیل کنند. از شاخص‌ترین آن‌ها می‌توان به Midjourney، DALL-E 3 و Stable Diffusion اشاره کرد که قاددرند تصاویری در هر سبک هنری، عکاسی یا گرافیکی خلق کنند.
ابزارهای تولید و ویرایش ویدیو (Text-to-Video و Image-to-Video): نسل جدید هوش مصنوعی قادر است متون یا تصاویر ثابت را به ویدیوهای چندثانیه‌ای پویا و سینمایی تبدیل کند. ابزارهایی مانند Runway (Gen-2 / Gen-3)، Pika Labs و Sora (توسعه‌یافته توسط OpenAI) نمونه‌های پیشرفته‌ای هستند که فیزیک حرکت، نورپردازی و تعامل اجسام را به طور واقع‌گرایانه شبیه‌سازی می‌کنند.
ابزارهای ارتقای کیفیت و ویرایش (Upscaling & Enhancement): این سیستم‌ها وظیفه افزایش رزولوشن، بهبود جزئیات چهره و رفع تاری تصاویر و ویدیوهای تولیدی یا قدیمی را بر عهده دارند.
۳. نحوه تولید تصویر با یک پرامپت (راهنمای جامع گام‌به‌گام)
برای اینکه بهترین خروجی را از ابزارهای تولید تصویر بگیرید، باید هنر «پرامپت‌نویسی» (Prompt Engineering) را بیاموزید. پرامپت در واقع توصیف متنی شما از تصویر دلخواهتان است. ساختار یک پرامپت حرفه‌ای شامل اجزای زیر است:
موضوع اصلی (Subject): مشخص کنید چه چیزی باید در تصویر باشد (مثلاً: یک گربه‌ی فضانورد).
جزئیات و پس‌زمینه (Details & Background): محیط، لباس، رنگ‌ها و جزئیات دقیق‌تر را توصیف کنید (مثلاً: با لباس فضایی سفید، در حال نگاه کردن به سیاره زمین از ماه).
سبک هنری (Art Style): تعیین کنید سبک تصویر چگونه باشد؛ عکاسی رئال، نقاشی رنگ روغن، انیمیشن سه‌بعدی، سایبرپانک یا مینیمال.
نورپردازی و دوربین (Lighting & Camera): نوع نور (مانند نور طلایی غروب، نور استودیویی) و زاویه دوربین (مانند نمای نزدیک، زاویه دید پرنده) را مشخص نمایید.
نمونه عملی پرامپت‌نویسی:
فرض کنید می‌خواهیم یک تصویر سینمایی و باکیفیت از یک خودروی مدرن در شهر آینده تولید کنیم. پرامپت انگلیسی استاندارد آن به شکل زیر خواهد بود:

Prompt: A futuristic luxury sports car driving through a neon-lit cyberpunk city at night, rain reflections on the wet asphalt, cinematic lighting, highly detailed, 8k resolution, photorealistic, shot on 35mm lens –ar 16:9

ترجمه و تحلیل اجزای پرامپت بالا: A futuristic luxury sports car driving through a neon-lit cyberpunk city at night: موضوع اصلی (خودروی اسپرت لوکس آینده‌نگر در شهر سایبرپانک نئونی شبانه).
rain reflections on the wet asphalt: جزئیات محیطی (بازتاب باران روی آسفالت خیس).
cinematic lighting, highly detailed, 8k resolution, photorealistic: تعیین کیفیت و سبک عکاسی رئال (نورپردازی سینمایی، جزئیات بالا، رزولوشن 8k، کاملاً واقع‌گرایانه).
shot on 35mm lens –ar 16:9: تنظیمات دوربین و نسبت تصویر (لنز ۳۵ میلی‌متری، نسبت تصویر عریض ۱۶:۹).
با رعایت این اصول و تمرین مداوم، می‌توانید دقیقاً همان تصویری که در ذهن دارید را توسط هوش مصنوعی به دنیای واقعیت بیاورید.

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *