- پرامپت ساخت ویدیو با هوش مصنوعی همان چیزی است که فاصله بین یک ایده جذاب و یک ویدیوی خراب را مشخص میکند. ممکن است ابزار قدرتمندی مثل Veo، Sora یا Kling در اختیار داشته باشید، اما اگر فقط بنویسید «یک تبلیغ حرفهای بساز»، مدل نمیداند دوربین کجا باشد، سوژه چه کاری انجام دهد، نور چه حالتی داشته باشد و فضای ویدیو چطور شنیده شود.
یک پرامپت ساخت ویدیو با هوش مصنوعی خوب لازم نیست پر از اصطلاحات سخت سینمایی باشد. کافی است خواسته خود را به اجزای روشن تقسیم کنید و به مدل بگویید چه چیزی دیده شود، چه حرکتی اتفاق بیفتد، دوربین چطور رفتار کند و نتیجه چه حس و سبکی داشته باشد. در این راهنما یاد میگیرید چطور همین کار را مرحلهبهمرحله انجام دهید.
ساختار یک پرامپت حرفهای و قابل کنترل
یک پرامپت ساخت ویدیو با هوش مصنوعی حرفهای معمولا از چند بخش اصلی تشکیل میشود: سوژه، حرکت، محیط، دوربین، سبک بصری، نور و صدا. راهنمای رسمی گوگل برای Veo نیز پیشنهاد میکند نوع ویدیو، سبک، شخصیت، حرکت دوربین و طراحی صدا بهشکل روشن توصیف شوند. راهنمای Kling هم فرمولی بر پایه سوژه، حرکت، صحنه، زبان دوربین و نور ارائه میدهد.
برای مثال بهجای اینکه بنویسید «یک زن در خیابان راه میرود»، بنویسید: «یک زن جوان با کت طوسی در خیابان بارانی تهران قدم میزند، دوربین با حرکت آرام از کنار او عبور میکند، نور چراغ مغازهها روی آسفالت خیس افتاده و صدای باران و رفتوآمد خودروها شنیده میشود.»
این توضیح به مدل کمک میکند تصویر، حرکت و فضای صوتی را هماهنگتر بسازد. هرچه خواسته شما روشنتر باشد، احتمال اینکه مدل بخشهای مهم را حدس بزند کمتر میشود.
فرمول ساده پرامپت ساخت ویدیو با هوش مصنوعی
برای نوشتن یک پرامپت ساخت ویدیو با هوش مصنوعی میتوانید از این فرمول استفاده کنید:
سوژه + حرکت سوژه + محیط + حرکت دوربین + نور + سبک + صدا
نمونه:
«یک ساعت لوکس نقرهای روی میز سنگی مشکی قرار دارد، عقربهها آرام حرکت میکنند، دوربین از نمای نزدیک با حرکت چرخشی دور ساعت میگردد، نور طلایی از سمت راست میتابد، سبک تبلیغات لوکس و سینمایی، صدای آرام تیکتاک ساعت و موسیقی مینیمال در پسزمینه.»
این فرمول برای تبلیغات، ریلز، معرفی محصول، ویدیوی آموزشی و حتی صحنههای داستانی کاربرد دارد. لازم نیست همیشه تمام بخشها را بنویسید، اما حذف هر بخش یعنی کنترل کمتری روی همان قسمت خواهید داشت.
سوژه را دقیق معرفی کنید
اولین بخش هر پرامپت ساخت ویدیو با هوش مصنوعی معرفی سوژه است. عبارتهایی مثل «یک مرد»، «یک محصول» یا «یک ماشین» اطلاعات کمی به مدل میدهند. بهتر است ویژگیهایی را بنویسید که واقعا روی تصویر اثر دارند.
برای شخصیت میتوانید سن تقریبی، لباس، حالت چهره و موقعیت او را مشخص کنید. برای محصول نیز جنس، رنگ، شکل و نحوه قرارگیری مهم است. مثلا «یک کیف چرمی قهوهای دستدوز با قفل طلایی روی پایه سفید» خیلی دقیقتر از «یک کیف روی میز» است.
زیادهروی هم نتیجه را خراب میکند. اگر دهها ویژگی متناقض برای یک شخصیت بنویسید، مدل ممکن است بعضی موارد را نادیده بگیرد. فقط جزئیاتی را ذکر کنید که در خروجی باید دیده شوند.
حرکت سوژه را ساده و مرحلهای بنویسید
در پرامپت ساخت ویدیو با هوش مصنوعی بهتر است برای هر شات یک حرکت اصلی تعریف کنید. اگر از مدل بخواهید شخصیت هم راه برود، هم صحبت کند، هم لباسش را عوض کند و هم وارد خودروی در حال حرکت شود، احتمال خطا بیشتر میشود.
بهجای دستور شلوغ میتوانید حرکت را به چند مرحله کوتاه تقسیم کنید:
- شخصیت به سمت پنجره قدم میزند.
- چند لحظه بیرون را نگاه میکند.
- سپس آرام سرش را به سمت دوربین برمیگرداند.
راهنمای Sora 2 نیز روی توصیف روشن حرکت، زمانبندی و ساختار نما تاکید میکند. این مدلها وقتی میدانند در هر لحظه چه اتفاقی باید بیفتد، خروجی منظمتری میسازند.
حرکت دوربین را چطور توصیف کنیم؟
دوربین یکی از مهمترین بخشهای پرامپت ساخت ویدیو با هوش مصنوعی است. اگر چیزی درباره دوربین ننویسید، مدل خودش زاویه و حرکت را انتخاب میکند و ممکن است نتیجه با تصور شما فرق داشته باشد.
چند دستور کاربردی عبارتاند از:
- نمای نزدیک از صورت
- نمای باز از محیط
- دوربین ثابت
- حرکت آرام دوربین به جلو
- حرکت دوربین از چپ به راست
- نمای دنبالکننده از پشت سوژه
- چرخش آرام دور سوژه
- نمای هوایی
مثلا برای معرفی یک محصول بنویسید: «نمای نزدیک، دوربین با حرکت بسیار آرام به محصول نزدیک میشود و فوکوس روی لوگوی برند قرار میگیرد.» این جمله ساده نتیجه قابلکنترلتری نسبت به عبارت کلی «ویدیوی حرفهای از محصول» میدهد.

سبک، نور و رنگ را یکدست نگه دارید
یک پرامپت ساخت ویدیو با هوش مصنوعی باید حالوهوای مشخصی داشته باشد. ترکیب عبارتهایی مثل «مستند طبیعی»، «انیمیشن کارتونی»، «نور ترسناک» و «تبلیغ لوکس» در یک شات میتواند مدل را گیج کند.
ابتدا یک سبک اصلی انتخاب کنید:
- واقعگرایانه و طبیعی
- تبلیغاتی و لوکس
- سینمایی و دراماتیک
- مستند و ساده
- انیمیشن سهبعدی
- استاپموشن
- ویدیوی موبایلی و خودمانی
بعد نور و رنگ را با همان سبک هماهنگ کنید. برای تبلیغ لوکس، نور کنترلشده، پسزمینه تیره و رنگهای طلایی مناسباند. برای محتوای روزمره، نور طبیعی پنجره و رنگهای واقعی انتخاب بهتری هستند.
صدا و دیالوگ را جداگانه مشخص کنید
در مدلهایی که صدای هماهنگ تولید میکنند، پرامپت ساخت ویدیو با هوش مصنوعی فقط درباره تصویر نیست. Veo 3.1، Sora 2 و Kling Video 3.0 امکان تولید صدا یا دیالوگ هماهنگ را ارائه میدهند. در راهنمای Veo توصیه شده است صدای محیط، موسیقی، جلوه صوتی و گفتوگو بهطور روشن در پرامپت مشخص شوند.
برای مثال:
«صدای باران ملایم، عبور دور خودروها و موسیقی آرام پیانو شنیده شود. شخصیت با صدای طبیعی و آرام میگوید: امروز همهچیز از یک تصمیم کوچک شروع میشود.»
دیالوگ را کوتاه نگه دارید. جملههای طولانی یا حضور چند گوینده ممکن است هماهنگی لب و صدا را ضعیف کند. برای شروع، یک جمله کوتاه و یک صدای محیط مشخص انتخاب کنید.
نمونه پرامپت ضعیف و نسخه حرفهای آن
بسیاری از کاربران یک پرامپت ساخت ویدیو با هوش مصنوعی را خیلی کلی مینویسند:
نسخه ضعیف:
«یک تبلیغ جذاب برای کفش بساز.»
این دستور مشخص نمیکند کفش چه شکلی است، چه کسی آن را پوشیده، دوربین چطور حرکت میکند و فضای تبلیغ چیست.
نسخه بهتر:
«یک کفش ورزشی سفید با جزئیات آبی روی سکوی بتنی در استودیوی مدرن قرار دارد. دوربین با نمای نزدیک از کنار کفش حرکت میکند، سپس یک ورزشکار کفش را میپوشد و روی پیست خیس شروع به دویدن میکند. نور سرد صبحگاهی، سبک تبلیغ ورزشی سینمایی، صدای برخورد کفش با زمین و موسیقی پرانرژی.»
نسخه دوم به مدل مسیر مشخصی میدهد و برای اصلاح خروجی نیز نقطه شروع بهتری است.
پرامپت تصویر به ویدیو چه فرقی دارد؟
در حالت تصویر به ویدیو، تصویر مرجع بخش زیادی از ظاهر صحنه را مشخص کرده است. بنابراین پرامپت ساخت ویدیو با هوش مصنوعی باید بیشتر روی حرکت، دوربین، نور متغیر و اتفاقی که قرار است رخ دهد تمرکز کند.
مثلا اگر عکس یک مدل لباس را بارگذاری کردهاید، لازم نیست دوباره تمام جزئیات لباس را توضیح دهید. بنویسید:
«مدل آرام دو قدم به سمت دوربین حرکت میکند، پارچه لباس با وزش باد ملایم حرکت میکند، دوربین ثابت است و نور پنجره بهآرامی روی صورت تغییر میکند.»
در Kling Video Omni، تصویر، ویدیو و عناصر مرجع نیز بخشی از ورودی محسوب میشوند و متن باید تغییر یا حرکت موردنظر را مشخص کند.
برای ویدیوی چندشاتی چه بنویسیم؟
اگر چند نما میخواهید، پرامپت ساخت ویدیو با هوش مصنوعی را به شاتهای جدا تقسیم کنید. Kling Video 3.0 قابلیت Multi-Shot دارد و میتواند زاویههای مختلف را بر اساس ساختار صحنه مدیریت کند.
نمونه:
شات اول: نمای باز از کافه در صبح بارانی.
شات دوم: نمای نزدیک از ریختن قهوه داخل فنجان.
شات سوم: مشتری فنجان را برمیدارد و لبخند میزند.
صدا: باران، صدای دستگاه قهوه و موسیقی آرام.
در هر شات یک اتفاق اصلی تعریف کنید و ظاهر شخصیت یا محصول را ثابت نگه دارید. اگر ویژگی مهمی مثل رنگ لباس یا مدل محصول باید حفظ شود، در هر شات کوتاه به آن اشاره کنید.
اشتباهات رایج در نوشتن پرامپت ویدیو
یک پرامپت ساخت ویدیو با هوش مصنوعی ممکن است طولانی باشد، اما همچنان نتیجه خوبی ندهد. مشکل معمولا از تناقض، خواستههای زیاد یا توضیحات مبهم میآید.
اشتباهات رایج عبارتاند از:
- نوشتن چند حرکت پیچیده در یک شات
- مشخص نکردن زاویه یا حرکت دوربین
- ترکیب سبکهای متناقض
- درخواست دیالوگ خیلی طولانی
- استفاده از صفتهای کلی مثل «خفن» و «حرفهای»
- تغییر چهره و لباس شخصیت بین شاتها
- ننوشتن نسبت تصویر و کاربرد ویدیو
- انتظار نتیجه نهایی با اولین تولید
بهتر است ابتدا نسخه ساده بسازید و بعد فقط یک یا دو بخش را تغییر دهید. اگر همزمان سوژه، نور، دوربین، محیط و سبک را عوض کنید، متوجه نمیشوید کدام تغییر باعث بهتر یا بدتر شدن نتیجه شده است.
چکلیست نهایی قبل از تولید ویدیو
قبل از اجرای پرامپت ساخت ویدیو با هوش مصنوعی این موارد را بررسی کنید:
- سوژه دقیق و قابلتصور است؟
- حرکت اصلی مشخص شده است؟
- محیط و زمان صحنه معلوم است؟
- زاویه و حرکت دوربین نوشته شده است؟
- سبک و نور با هم هماهنگاند؟
- صدا یا دیالوگ کوتاه و روشن است؟
- نسبت تصویر با محل انتشار هماهنگ است؟
- در هر شات فقط یک اتفاق اصلی رخ میدهد؟
این چکلیست ساده تعداد آزمونهای بینتیجه را کمتر میکند و کمک میکند اعتبار یا زمان خود را برای پرامپتهای مبهم هدر ندهید.

سوالات متداول درباره پرامپت ساخت ویدیو با هوش مصنوعی
| سوال | پاسخ |
|---|---|
| پرامپت ویدیو باید کوتاه باشد یا بلند؟ | طول مشخصی وجود ندارد. مهم این است که سوژه، حرکت، محیط، دوربین و سبک روشن باشند. یک متن کوتاه و دقیق معمولا از توضیح بلند و متناقض بهتر است. |
| آیا پرامپت فارسی برای ساخت ویدیو مناسب است؟ | بسیاری از ابزارها فارسی را درک میکنند، اما ممکن است بعضی اصطلاحات دوربین یا سبک در انگلیسی نتیجه دقیقتری بدهند. بهتر است هر دو حالت را آزمایش کنید. |
| چرا نتیجه با چیزی که نوشتهام فرق دارد؟ | ممکن است پرامپت مبهم یا بیش از حد شلوغ باشد. دستور را ساده کنید، حرکتها را کاهش دهید و برای هر شات فقط یک اتفاق اصلی تعریف کنید. |
| برای ثابت ماندن چهره چه کاری انجام دهیم؟ | از تصویر مرجع باکیفیت استفاده کنید، ویژگیهای اصلی شخصیت را ثابت نگه دارید و تغییرهای شدید زاویه، لباس و نور را در یک شات کاهش دهید. |
| بهترین فرمول پرامپت ساخت ویدیو با هوش مصنوعی چیست؟ | فرمول کاربردی شامل سوژه، حرکت، محیط، دوربین، نور، سبک و صداست. بر اساس نوع پروژه میتوانید بعضی بخشها را حذف یا دقیقتر کنید. |
سخن آخر
نوشتن پرامپت ساخت ویدیو با هوش مصنوعی بیشتر از اینکه به اصطلاحات پیچیده وابسته باشد، به شفاف بودن ایده نیاز دارد. وقتی سوژه، حرکت، دوربین، نور و صدا را جداگانه تعریف کنید، مدل راحتتر منظور شما را میفهمد و نتیجه قابلکنترلتری میسازد.
برای گرفتن خروجی بهتر، پرامپت را مرحلهبهمرحله اصلاح کنید و از یک درخواست شلوغ انتظار نتیجه نهایی نداشته باشید. برای آشنایی بیشتر با قابلیتهای تولید ویدیو، صدای هماهنگ و روش استفاده از ابزار گوگل، مقاله ((هوش مصنوعی Veo)) را مطالعه کنید. این راهنما کمک میکند پرامپت ساخت ویدیو با هوش مصنوعی را متناسب با امکانات Veo طراحی کنید و از قابلیتهای آن هدفمندتر استفاده کنید.
