ساخت ویدیو با هوش مصنوعی در ۵ مرحله؛ ورکفلو واقعی ۲۰۲۶
ساخت ویدیو با هوش مصنوعی با یک پرامپت جادویی شروع و تمام نمیشود. اگر خروجی حرفهای میخواهید، باید درست مثل یک پروژه واقعی فیلمسازی جلو بروید: هدف را مشخص کنید، سناریو را به شاتهای قابلساخت بشکنید، ظاهر پروژه را روی چند تصویر ثابت کنید، هر شات را جداگانه متحرک کنید و در پایان با تدوین و صدا همهچیز را به یک ویدیوی منسجم تبدیل کنید.
این راهنما نسخه بهروزشده ۲۰۲۶ از ورکفلویی است که معین یارمحمدی در پروژههای واقعی ریکولی استفاده میکند. تجربه ما این است که بخش اصلی کیفیت در مرحله تصویرسازی و تصمیمهای قبل از تولید ساخته میشود؛ نه در آخرین کلیکی که روی دکمه Generate میزنیم.
پاسخ سریع: مسیر حرفهای پنج مرحله دارد: ۱) تعریف Brief، ۲) سناریو و استوریبورد، ۳) ساخت Visual Bible و کیفریمها، ۴) تبدیل هر تصویر به چند برداشت ویدیویی، ۵) تدوین، صداگذاری و خروجی نهایی.
آخرین بازبینی تخصصی: ۶ مرداد ۱۴۰۵
اگر خروجی شما مشخصاً برای اینستاگرام است، راهنمای ساخت ریلز با هوش مصنوعی را هم ببینید؛ در آن Workflow عمودی، ثبات کاراکتر، انتخاب ابزار براساس بودجه و خروجی نهایی ریلز را جداگانه بررسی کردهایم.
قبل از شروع ساخت ویدیو با هوش مصنوعی چه چیزهایی را مشخص کنیم؟
بزرگترین اشتباه این است که ابزار را قبل از پروژه انتخاب کنیم. ابتدا این هفت تصمیم را بنویسید:
- هدف: فروش، معرفی برند، آموزش، موزیکویدیو یا جذب مخاطب؟
- مخاطب: قرار است چه کسی ویدیو را ببیند و چه حسی بگیرد؟
- پلتفرم: ریلز عمودی، یوتیوب افقی، نمایشگر شهری یا صفحه محصول؟
- مدت: ۱۵، ۳۰ یا ۶۰ ثانیه؟
- هویت بصری: واقعگرا، تبلیغاتی، انیمه، سورئال یا سینمایی؟
- صدا: موسیقی، نریشن، دیالوگ یا طراحی صدای محیط؟
- بودجه: چند بار میتوانید هر شات را آزمایش و اصلاح کنید؟
خروجی این بخش یک Brief کوتاه است؛ مثلاً: «تیزر ۳۰ ثانیهای عمودی برای معرفی یک عطر، مخاطب ۲۰ تا ۳۵ سال، حس مرموز و لوکس، پنج شات، بدون دیالوگ و با پایان محصولمحور.» چنین جملهای صد برابر مفیدتر از دستور مبهم «یک تبلیغ خفن بساز» است.
مرحله اول: ایده را به یک Brief قابلساخت تبدیل کنید
ChatGPT و ابزارهای مشابه برای توسعه ایده و پیدا کردن حفرههای سناریو عالیاند، اما نباید تصمیم خلاقه را کامل به آنها واگذار کنید. ابتدا ایده خام، محصول، محدودیت بودجه و پلتفرم را بدهید و بخواهید خروجی را به شاتهای کوتاه و قابلکنترل تبدیل کند.
پرامپت پیشنهادی برای تبدیل ایده به Brief
من میخواهم یک ویدیوی [مدت] ثانیهای برای [پلتفرم] بسازم. هدف [هدف] و مخاطب [مخاطب] است. سبک بصری [سبک] و بودجه تولید [کم/متوسط/بالا] است. ایده خام من: [ایده]. سناریو را به پنج تا هشت شات کوتاه و قابلساخت با هوش مصنوعی تبدیل کن. برای هر شات، نوع نما، سوژه، کنش، محیط، نور، حرکت دوربین و صدای لازم را مشخص کن. محدودیتهای ابزار و ثبات شخصیت را هم در نظر بگیر.
بعد از دریافت پاسخ، حذفکردن مهمتر از اضافهکردن است. هر شاتی که داستان، ریتم یا فروش را جلو نمیبرد کنار بگذارید. ویدیوی کوتاه خوب معمولاً یک ایده واضح دارد، نه ده ایده نصفه.
مرحله دوم: سناریو را به Shot List و Storyboard تبدیل کنید
مدلهای ویدیویی جدید در ۲۰۲۶ کنترل بیشتری ارائه میکنند، اما یک شات کوتاه و دقیق هنوز قابلاعتمادتر از یک درخواست طولانی و شلوغ است. سناریو را به واحدهای تصویری مستقل تقسیم کنید. برای هر شات این موارد را ثبت کنید:
- شماره و مدت تقریبی شات؛
- اندازه نما و زاویه دوربین؛
- ظاهر ثابت شخصیت یا محصول؛
- فقط یک کنش اصلی؛
- حرکت دوربین؛
- نقطه شروع و پایان حرکت؛
- صدای محیط، افکت یا نریشن؛
- اتصال شات به تصویر قبل و بعد.
Storyboard لازم نیست نقاشی حرفهای باشد. حتی چند قاب ساده کمک میکند قبل از خرجکردن اعتبار ابزارها، بفهمید ترتیب شاتها جواب میدهد یا نه. در پروژههای حرفهای ریکولی، ابتدا همه تصاویر را کنار هم در تایملاین میگذاریم و یک Animatic ساده میسازیم. اگر ریتم و حس داستان در نسخه ثابت خوب نباشد، متحرککردنش هم مشکل را حل نمیکند.

مرحله سوم: Visual Bible و تصاویر مرجع را بسازید
اینجا نقطهای است که نتیجه آماتور از نتیجه حرفهای جدا میشود. در تجربه ما، ۸۰ تا ۹۰ درصد زمان مفید پروژه روی ساخت تصاویر، استوریبورد و هماهنگی شاتها صرف میشود. وقتی همه کیفریمها کنار هم حس و رنگ درستی داشتند، آنها را متحرک میکنیم.
Visual Bible یک برگه مرجع برای ثابت نگهداشتن پروژه است. در آن ظاهر شخصیت، لباس، سن، مدل مو، رنگها، لنز، نسبت تصویر، نور، بافت و لوکیشن را تعریف کنید. سپس برای هر شات، همان اطلاعات ثابت را نگه دارید و فقط کنش و ترکیببندی را تغییر دهید.
برای ساخت تصویر از چه ابزاری استفاده کنیم؟
ابزار را بر اساس پروژه و بودجه انتخاب کنید، نه بر اساس ترند شبکههای اجتماعی:
- پروژه حرفهای و Art Direction دقیق: Midjourney یا مدلهای سطح بالای تصویر برای ساخت Hero Frame و ظاهر نهایی.
- اصلاح سریع، متن داخل تصویر و حفظ چند مرجع: خانواده Nano Banana، با توجه به نسخه و دسترسی موجود.
- تولید تعداد زیاد، کنترل بیشتر و بودجه متعادل: خانواده FLUX و مدل مناسب سرعت یا کیفیت.
هیچ مدلی در همه سبکها برنده نیست. یک ابزار ممکن است پرتره را عالی بسازد و در معماری یا نوشته داخل تصویر خطا کند. قبل از تولید انبوه، یک شات سخت را بهعنوان تست انتخاب کنید و همان را با دو گزینه بسنجید.
چکلیست ثبات تصویر
- چهره، سن و فرم بدن شخصیت بین شاتها تغییر نکرده باشد؛
- لباس، اکسسوری و رنگهای کلیدی ثابت بمانند؛
- جهت نور و زمان روز ناگهان عوض نشود؛
- لنز و عمق میدان با زبان بصری پروژه هماهنگ باشد؛
- دستها، نوشتهها، لوگو و جزئیات محصول در اندازه واقعی بررسی شوند؛
- فایل اصلی، پرامپت، Seed و نسخههای تأییدشده آرشیو شوند.
برای دقیقترشدن دستورهای تصویری، راهنمای جامع پرامپتنویسی برای ساخت تصویر را هم ببینید.
مرحله چهارم: تصاویر را به شاتهای ویدیویی تبدیل کنید
حالا برای هر تصویر ثابت، دو یا سه برداشت کوتاه بسازید. تلاش برای تولید کل ویدیو در یک خروجی بلند، کنترل را کم و هزینه اصلاح را زیاد میکند. هر شات باید یک حرکت اصلی داشته باشد: حرکت شخصیت، حرکت دوربین یا تغییر محیط. ترکیب همزمان چند حرکت پیچیده معمولاً احتمال اعوجاج را بالا میبرد.
فرمول پرامپت ویدیویی
نوع نما + ظاهر دقیق سوژه + کنش اصلی + محیط + نور و سبک + حرکت دوربین + سرعت و ریتم حرکت + صدا یا دیالوگ + محدودیتهای صحنه
نمونه: «مدیوم کلوزآپ از بطری عطر شیشهای مشکی روی سنگ خیس؛ مه آرام از پشت حرکت میکند؛ نور طلایی باریک از سمت راست لبه شیشه را روشن میکند؛ دوربین یک Push-in بسیار آهسته دارد؛ محصول و نوشته روی بطری ثابت بماند؛ بدون چرخش ناگهانی و بدون اضافهشدن شیء جدید.»
اگر هدف شما تبلیغ محصول، ریلز یا موزیکویدیو است، نمونهپرامپتهای ساخت ویدیوی تبلیغاتی را ببینید؛ آن راهنما همین فرمول را با مثالهای قابل شخصیسازی برای حرکت دوربین، سوژه، محیط و پایان شات کامل میکند.
Seedance، Kling یا Veo؟
انتخاب به نوع شات، ورودیهای مرجع، نیاز به صدا، رزولوشن و سطح دسترسی شما بستگی دارد. Seedance 2.0 برای ورودیهای چندرسانهای و توالی چندشاته، Kling 3.0 برای کنترل شات و منابع مرجع، و Veo 3.1 برای کنترل سینمایی و اکوسیستم Google گزینههای مهم ۲۰۲۶ هستند؛ اما مشخصات صدا و کیفیت خروجی بین نسخهها، endpointها و پلنها یکسان نیست.
برای تصمیم دقیقتر، مقاله مقایسه بهترین هوش مصنوعیهای ساخت ویدیو در ۲۰۲۶ را بخوانید. آن صفحه برای انتخاب ابزار است؛ این صفحه برای اجرای درست پروژه.
اگر میخواهید همین Workflow را با پروژه واقعی و بهصورت مرحلهبهمرحله تمرین کنید، سرفصلهای دوره ساخت تصویر و ویدیو با هوش مصنوعی ریکولی را ببینید.
مرحله پنجم: تدوین، صداگذاری و خروجی نهایی
تدوین «اختیاری» نیست. حتی بهترین مدل ویدیو هم تصمیم نمیگیرد کدام Take بهتر است، کات کجا بخورد، ریتم چطور ساخته شود یا صدای کدام شات باید روی تصویر بعدی ادامه پیدا کند. خروجیهای منتخب را وارد Premiere یا نرمافزار تدوین دلخواه کنید و این مراحل را انجام دهید:
- بهترین برداشت هر شات را بر اساس حرکت، ثبات و ارتباط با شات بعد انتخاب کنید.
- ابتدا Rough Cut را بدون افکتهای اضافه ببندید.
- کاتها را با ریتم موسیقی، حرکت یا Sound Effect پوشش دهید.
- اختلاف رنگ، کنتراست، Grain و وضوح شاتهای ساختهشده با مدلهای مختلف را یکدست کنید.
- نریشن و دیالوگ فارسی را در تدوین کنترل کنید؛ روی پشتیبانی خودکار همه مدلها حساب نکنید.
- زیرنویس، لوگو و متن محصول را در مرحله تدوین اضافه کنید تا خوانا و ثابت بمانند.
- خروجی جداگانه متناسب با اینستاگرام، یوتیوب، سایت یا نمایشگر مشتری بگیرید.
اگر این بخش نقطه ضعف شماست، دوره جامع پریمیر ریکولی تدوین، صداگذاری، زیرنویس و خروجی حرفهای را پروژهمحور آموزش میدهد.
برای بودجه کم، متوسط و حرفهای چه مسیری بهتر است؟
بودجه کم
تعداد شاتها را کم کنید، ابتدا تصاویر را با مدلهای سریعتر بسازید، فقط شاتهای تأییدشده را متحرک کنید و بهجای دیالوگ پیچیده از نریشن و طراحی صدا در تدوین استفاده کنید. هدف «کمترین قیمت هر Generation» نیست؛ هدف کمترین هزینه برای یک شات قابلاستفاده است.
بودجه متوسط
برای ظاهر پروژه یک مدل تصویر قابلاعتماد انتخاب کنید و سختترین شاتها را با مدل ویدیویی قویتر بسازید. شاتهای سادهتر میتوانند با گزینه اقتصادی تولید شوند، اما رنگ و بافت آنها در تدوین باید یکدست شود.
پروژه حرفهای
قبل از تولید، Art Direction و Visual Bible را نهایی کنید. برای هر شات چند Take بگیرید، سختترین حرکتها را زودتر آزمایش کنید و برای بازسازی جزئیات محصول یا چهره بودجه اصلاح در نظر بگیرید. خروجی نهایی باید از کنترل انسانی در تدوین، صدا و بازبینی حقوقی عبور کند.
هفت اشتباه که پروژه AI Video را خراب میکند
- شروع تولید بدون Brief و سناریوی نهایی؛
- تغییر مدل و سبک در میانه پروژه بدون Visual Bible؛
- متحرککردن همه تصاویر قبل از ساخت Animatic؛
- دادن چند کنش پیچیده به یک پرامپت؛
- پذیرفتن اولین خروجی و بررسینکردن دست، چهره، محصول و نوشته؛
- نادیدهگرفتن تدوین، صدا و زیرنویس؛
- بررسینکردن مجوز استفاده تجاری، واترمارک و شرایط پلن.
نمونهها و راهحلهای تکمیلی را در مقاله ۵ اشتباه رایج در تولید ویدیو با هوش مصنوعی توضیح دادهایم.
نکات مهم برای کاربران ایرانی
قبل از خرید اعتبار یک سرویس خارجی، فقط کیفیت دمو را نبینید. روش پرداخت، نیاز به VPN، پایداری حساب، تاریخ انقضای Credit، واترمارک، صف تولید و مجوز استفاده تجاری را بررسی کنید. قیمتها و دسترسیها سریع تغییر میکنند؛ به همین دلیل در این راهنما عدد ثابت ندادهایم.
ریکولی در حال توسعه زیرساخت آسون AI برای دسترسی سادهتر و پرداخت تومانی است. تا زمان راهاندازی عمومی، هر ادعای مربوط به مدلها و پلنهای داخل آن باید در صفحه رسمی خودش بررسی شود.
این Workflow را پروژهمحور یاد بگیرید
دانستن نام ابزارها کافی نیست. چیزی که شما را به خروجی قابلفروش میرساند، توانایی ساخت سناریو، طراحی شات، حفظ هویت بصری، انتخاب مدل مناسب، اصلاح خطا و تدوین نهایی است.
در دوره ساخت تصویر و ویدیو با هوش مصنوعی ریکولی این مسیر با پروژه و فایل تمرینی آموزش داده میشود. دوره دسترسی دائمی، آپدیت رایگان، پشتیبانی، گواهی و آموزش مسیر ورود به بازار کار دارد. سرفصلها را ببینید و بررسی کنید که این مسیر با هدف شما هماهنگ است یا نه.
مشاهده سرفصلها و ثبتنام دوره هوش مصنوعی
اگر بهجای یادگیری، اجرای پروژه را میخواهید، از صفحه خدمات تولید محتوا و ویدیو ریکولی با تیم ما در ارتباط باشید.
سوالات متداول ساخت ویدیو با هوش مصنوعی
آیا میتوان رایگان با هوش مصنوعی ویدیو ساخت؟
بعضی ابزارها اعتبار آزمایشی یا پلن محدود دارند، اما پروژه حرفهای معمولاً به چند برداشت، اصلاح و خروجی بدون واترمارک نیاز دارد. رایگانبودن برای تمرین مناسب است؛ برای سفارش تجاری باید هزینه شات قابلاستفاده را حساب کنید.
بهترین هوش مصنوعی ساخت ویدیو کدام است؟
پاسخ ثابت ندارد. Seedance، Kling و Veo هرکدام در نوع خاصی از ورودی، حرکت، صدا یا کنترل شات مزیت دارند. بهترین انتخاب به سبک پروژه، بودجه، رزولوشن و سطح دسترسی شما بستگی دارد.
برای پروژه حرفهای اول عکس بسازیم یا مستقیم Text-to-Video؟
برای کنترل شخصیت، محصول، رنگ و ترکیببندی، معمولاً Image-to-Video قابلکنترلتر است. Text-to-Video برای ایدهپردازی، شاتهای محیطی یا زمانی که ثبات دقیق لازم نیست مفید است.
چطور چهره و کاراکتر را بین شاتها ثابت نگه داریم؟
یک تصویر مرجع اصلی، Visual Bible، مشخصات ثابت ظاهر و چند زاویه تأییدشده بسازید. در هر پرامپت فقط چیزی را تغییر دهید که مربوط به همان شات است و خروجیها را قبل از متحرکسازی کنار هم بررسی کنید.
آیا برای خروجی نهایی Premiere لازم است؟
Premiere تنها انتخاب نیست، اما تدوین نهایی لازم است. انتخاب Take، ریتم، صدا، زیرنویس، اصلاح رنگ و خروجی پلتفرم باید در یک نرمافزار تدوین کنترل شود.
ساخت یک ویدیوی ۳۰ ثانیهای چقدر زمان میبرد؟
به تعداد شات، ثبات کاراکتر، پیچیدگی حرکت و تعداد اصلاحها بستگی دارد. یک ویدیوی ساده میتواند در چند ساعت آماده شود، اما پروژه تبلیغاتی کنترلشده ممکن است چند روز زمان ببرد. کیفیت را با تعداد Generation اشتباه نگیرید.
کدام ابزار دیالوگ فارسی تولید میکند؟
پشتیبانی زبان در مدلها و نسخهها تغییر میکند و فارسی همیشه در فهرست رسمی نیست. برای پروژه جدی، نریشن یا دیالوگ فارسی را جداگانه ضبط یا تولید و در تدوین سینک کنید.
آیا خروجی AI برای تبلیغات و استفاده تجاری مجاز است؟
به قوانین همان سرویس، پلن شما و داراییهای مرجع بستگی دارد. پیش از انتشار، شرایط استفاده تجاری، حقوق چهره، موسیقی، فونت، لوگو و تصاویر ورودی را بررسی کنید.
دیدگاهتان را بنویسید