۱. مقدمه و تاریخچه هوش مصنوعی
هوش مصنوعی (Artificial Intelligence) دیگر تنها مفهومی در فیلمهای علمی-تخیلی نیست، بلکه به بخشی جداییناپذیر از زندگی بشر تبدیل شده است. ریشههای شکلگیری هوش مصنوعی به دهه ۱۹۵۰ میلادی بازمیگردد؛ زمانی که دانشمندان برجستهای مانند آلن تورینگ (Alan Turing) این سوال بنیادین را مطرح کردند که «آیا ماشینها میتوانند فکر کنند؟».
دهه ۱۹۵۰ تا ۱۹۶۰ (تولد و خوشبینی اولیه): این دوره با ابداع اصطلاح «هوش مصنوعی» در کنفرانس دارتموث (۱۹۵۶) و ساخت برنامههای ساده حل مسئله آغاز شد. محققان بسیار خوشبین بودند که ماشینها به زودی در تمامی زمینهها از انسان پیشی خواهند گرفت.
دهه ۱۹۷۰ تا ۱۹۸۰ (زمستانهای هوش مصنوعی): به دلیل محدودیتهای سختافزاری، کمبود بودجه و پیچیدگیهای محاسباتی، انتظارات برآورده نشد و پروژهها با رکود مواجه شدند که به این دوران «زمستان هوش مصنوعی» میگویند. در همین دوران، سیستمهای خبره (Expert Systems) بر پایه قوانین از پیش نوشته شده ظاهر شدند.
دهه ۱۹۹۰ تا ۲۰۱۰ (رشد دادهها و قدرت پردازشی): با افزایش قدرت پردازندهها (CPU و بعدتر GPU) و ظهور کلاندادهها (Big Data)، الگوریتمهای یادگیری ماشین (Machine Learning) توسعه یافتند. در سال ۱۹۹۷، کامپیوتر دیپ بلو (Deep Blue) شرکت IBM توانست قهرمان شطرنج جهان را شکست دهد.
سال ۲۰۱۰ به بعد (انقلاب یادگیری عمیق و هوش مصنوعی مولد): با ظهور شبکههای عصبی عمیق (Deep Learning)، شبکههای مولد مخاصم (GANها) و مدلهای ترنسفورمر، تحولی عظیم رخ داد. امروزه هوش مصنوعی از مرحله تحلیل داده عبور کرده و وارد فاز خلاقیت (تولید متن، تصویر، صدا و ویدیو) شده است.
۲. انواع هوش مصنوعی در زمینه تولید تصویر و ویدیو
امروزه ابزارهای مولد (Generative AI) میتوانند با دریافت دستورات متنی (Prompt)، تصاویری خیرهکننده و ویدیوهایی واقعگرایانه خلق کنند. این ابزارها بر اساس نوع خروجی به دستههای زیر تقسیم میشوند:
ابزارهای تولید تصویر (Text-to-Image): این سیستمها با استفاده از مدلهای انتشار (Diffusion Models) آموزش دیدهاند تا نویز تصادفی را به تصاویر باکیفیت تبدیل کنند. از شاخصترین آنها میتوان به Midjourney، DALL-E 3 و Stable Diffusion اشاره کرد که قاددرند تصاویری در هر سبک هنری، عکاسی یا گرافیکی خلق کنند.
ابزارهای تولید و ویرایش ویدیو (Text-to-Video و Image-to-Video): نسل جدید هوش مصنوعی قادر است متون یا تصاویر ثابت را به ویدیوهای چندثانیهای پویا و سینمایی تبدیل کند. ابزارهایی مانند Runway (Gen-2 / Gen-3)، Pika Labs و Sora (توسعهیافته توسط OpenAI) نمونههای پیشرفتهای هستند که فیزیک حرکت، نورپردازی و تعامل اجسام را به طور واقعگرایانه شبیهسازی میکنند.
ابزارهای ارتقای کیفیت و ویرایش (Upscaling & Enhancement): این سیستمها وظیفه افزایش رزولوشن، بهبود جزئیات چهره و رفع تاری تصاویر و ویدیوهای تولیدی یا قدیمی را بر عهده دارند.
۳. نحوه تولید تصویر با یک پرامپت (راهنمای جامع گامبهگام)
برای اینکه بهترین خروجی را از ابزارهای تولید تصویر بگیرید، باید هنر «پرامپتنویسی» (Prompt Engineering) را بیاموزید. پرامپت در واقع توصیف متنی شما از تصویر دلخواهتان است. ساختار یک پرامپت حرفهای شامل اجزای زیر است:
موضوع اصلی (Subject): مشخص کنید چه چیزی باید در تصویر باشد (مثلاً: یک گربهی فضانورد).
جزئیات و پسزمینه (Details & Background): محیط، لباس، رنگها و جزئیات دقیقتر را توصیف کنید (مثلاً: با لباس فضایی سفید، در حال نگاه کردن به سیاره زمین از ماه).
سبک هنری (Art Style): تعیین کنید سبک تصویر چگونه باشد؛ عکاسی رئال، نقاشی رنگ روغن، انیمیشن سهبعدی، سایبرپانک یا مینیمال.
نورپردازی و دوربین (Lighting & Camera): نوع نور (مانند نور طلایی غروب، نور استودیویی) و زاویه دوربین (مانند نمای نزدیک، زاویه دید پرنده) را مشخص نمایید.
نمونه عملی پرامپتنویسی:
فرض کنید میخواهیم یک تصویر سینمایی و باکیفیت از یک خودروی مدرن در شهر آینده تولید کنیم. پرامپت انگلیسی استاندارد آن به شکل زیر خواهد بود:
Prompt: A futuristic luxury sports car driving through a neon-lit cyberpunk city at night, rain reflections on the wet asphalt, cinematic lighting, highly detailed, 8k resolution, photorealistic, shot on 35mm lens –ar 16:9
ترجمه و تحلیل اجزای پرامپت بالا: A futuristic luxury sports car driving through a neon-lit cyberpunk city at night: موضوع اصلی (خودروی اسپرت لوکس آیندهنگر در شهر سایبرپانک نئونی شبانه).
rain reflections on the wet asphalt: جزئیات محیطی (بازتاب باران روی آسفالت خیس).
cinematic lighting, highly detailed, 8k resolution, photorealistic: تعیین کیفیت و سبک عکاسی رئال (نورپردازی سینمایی، جزئیات بالا، رزولوشن 8k، کاملاً واقعگرایانه).
shot on 35mm lens –ar 16:9: تنظیمات دوربین و نسبت تصویر (لنز ۳۵ میلیمتری، نسبت تصویر عریض ۱۶:۹).
با رعایت این اصول و تمرین مداوم، میتوانید دقیقاً همان تصویری که در ذهن دارید را توسط هوش مصنوعی به دنیای واقعیت بیاورید.



دیدگاهتان را بنویسید