تبدیل عکس به ویدیو با هوش مصنوعی در ۲۰۲۶
تبدیل عکس به ویدیو با هوش مصنوعی در ظاهر ساده است: یک تصویر آپلود میکنید، چند خط مینویسید و یک کلیپ تحویل میگیرید. اما تفاوت یک خروجی آزمایشی با شاتی که بتوان در ریلز، تبلیغ یا موزیکویدیو استفاده کرد، در انتخاب تصویر، طراحی حرکت، Prompt، مدل و تدوین نهایی است.
این راهنمای ۲۰۲۶ براساس تجربه معین یارمحمدی و تیم ریکولی در پروژههای واقعی نوشته شده است؛ از موزیکویدیوی «صحنه ۲» سیاوش شمس تا تیزرهای آب معدنی البرکا و نوشیدنی انرژیزای براق.
پاسخ کوتاه: برای نتیجه بهتر، تصویری انتخاب کنید که از قبل حس حرکت داشته باشد؛ سپس فقط اتفاقی را که باید در زمان رخ دهد بنویسید: حرکت دوربین، سوژه، پیشزمینه و پسزمینه. Prompt را کوتاه نگه دارید، شات را حدود پنج ثانیه بسازید و کلیپهای منتخب را در Premiere یا DaVinci تدوین کنید.
آخرین بازبینی تخصصی: ۱۰ مرداد ۱۴۰۵
تبدیل عکس به ویدیو با AI دقیقاً چیست؟
در حالت Image-to-Video، عکس ورودی ظاهر شات را تعیین میکند: سوژه، لباس، لوکیشن، ترکیببندی، نور، رنگ و زاویه دید. Prompt متنی بیشتر باید توضیح دهد که چه حرکتی اتفاق بیفتد. راهنمای رسمی Runway نیز همین تفکیک را پیشنهاد میکند: تصویر اطلاعات بصری را میدهد و متن روی حرکت سوژه، محیط، دوربین، جهت، سرعت و زمانبندی تمرکز میکند.
به همین دلیل، تکرار تمام جزئیات عکس در یک Prompt بلند معمولاً کمکی نمیکند. مدل تصویر را میبیند؛ شما باید آن را کارگردانی کنید.
آموزش سریع تبدیل عکس به ویدیو در ۶ مرحله
- یک تصویر تمیز، باکیفیت و دارای ترکیببندی مناسب انتخاب کنید.
- نسبت تصویر خروجی را قبل از Generate مشخص کنید: عمودی، افقی یا مربعی.
- یک کنش اصلی برای سوژه و یک حرکت مشخص برای دوربین انتخاب کنید.
- حرکت ضروری محیط و پیشزمینه را در یک جمله کوتاه اضافه کنید.
- ابتدا یک شات کوتاه تولید و فریمهای میانی آن را بررسی کنید.
- بهترین Take را دانلود و همراه صدا، رنگ و شاتهای دیگر تدوین کنید.
اگر میخواهید کل مسیر را از ایده و سناریو تا تدوین ببینید، راهنمای ساخت ویدیو با هوش مصنوعی در پنج مرحله مکمل این مقاله است.
عکس مناسب برای Image-to-Video چه ویژگیهایی دارد؟
بزرگترین تصمیم شما پیش از انتخاب ابزار گرفته میشود. تصویر خوب باید واضح باشد، اعضای بدن و محصول در آن سالم دیده شوند، پسزمینه بیدلیل شلوغ نباشد و فضای کافی برای حرکت احتمالی وجود داشته باشد.
معین معمولاً تصویری را ترجیح میدهد که از قبل در میانه حرکت باشد؛ مثلاً بدن دونده کمی به جلو متمایل، لباس در باد و گردوغبار پشت پا دیده شود. چنین Keyframeای به مدل میگوید حرکت از کجا ادامه پیدا کند. یک عکس کاملاً خشک و ایستا، مدل را مجبور میکند شروع حرکت را حدس بزند و احتمال خروجی مصنوعی بیشتر میشود.
- برای حرکت سریع، فضای خالی در جهت حرکت در نظر بگیرید.
- دستها، صورت، نوشته محصول و اشیای ظریف را قبل از تولید اصلاح کنید.
- برای ریلز، تصویر را از ابتدا ۹:۱۶ بسازید؛ Crop دیرهنگام میتواند ترکیببندی را خراب کند.
- برای Start-to-End Frame، ابتدا و انتها باید از نظر شخصیت، نور و هندسه به هم مربوط باشند.

فرمول Prompt برای تبدیل عکس به ویدیو
یک فرمول کاربردی این است:
حرکت دوربین + حرکت اصلی سوژه + حرکت ضروری محیط یا پیشزمینه + ریتم یا کیفیت حرکت
نمونهای که معین برای یک شات اکشن پیشنهاد میکند:
Camera follows the subject while keeping him in frame. The man runs toward the tower. Dust drifts through the atmosphere while distant birds cross the sky.
این Prompt کوتاه است، چون ظاهر مرد، برج، نور و رنگ قبلاً در تصویر وجود دارد. متن فقط حرکت را هدایت میکند.
حرکت دوربین
از یک دستور واضح استفاده کنید: Locked camera، slow push-in، handheld tracking، orbit، pan یا camera follows the subject. چند حرکت متناقض مانند Orbit، Zoom، Crane و Whip Pan در یک شات کوتاه، کنترل مدل را سخت میکند.
حرکت سوژه
کنش را فیزیکی و قابلدیدن بنویسید: «مرد بهسمت برج میدود»، «مدل آرام سرش را به دوربین برمیگرداند» یا «بطری روی سطح خیس میچرخد». عبارتهایی مثل «حس قدرتمند و خفن دارد» بهتنهایی حرکت قابلاجرا تعریف نمیکنند.
حرکت محیط و پیشزمینه
فقط جزئیاتی را اضافه کنید که به عمق یا داستان کمک میکنند: حرکت آرام مه، گردوغبار، پارچه، انعکاس نور یا عبور یک پرنده. اگر هر عنصر صحنه حرکت متفاوتی داشته باشد، احتمال اعوجاج بیشتر میشود.
چطور چهره، لباس و لوکیشن را ثابت نگه داریم؟
برای یک تکشات، بهترین راه این است که تصویر شروع را دقیق بسازید و فقط حرکت را به مدل بسپارید. برای چند شات، به سیستم مرجع نیاز دارید:
- Character Sheet: نمای روبهرو، سهرخ، نیمتنه و تمامقد همراه لباس و اکسسوری ثابت.
- Location Sheet: زاویههای مختلف لوکیشن، زمان روز، جهت نور، پالت رنگ و عناصر ثابت.
- Storyboard: قاب و کنش هر شات پیش از مصرف اعتبار ویدیویی.
- Reference Workflow: دادن مرجع شخصیت و لوکیشن هنگام ساخت عکس هر شات و سپس تبدیل تصاویر تأییدشده به ویدیو.
در پروژه پیچیده، معین از Character Sheet، Location Sheet و Storyboard در مدلی مانند Seedance استفاده میکند. در Workflow تصویرمحور نیز هر صحنه ابتدا با Referenceها در ChatGPT Image یا Nano Banana ساخته میشود و بعد سراغ Image-to-Video میرود.
اگر دست، صورت یا حرکت خراب شد چه کنیم؟
- Prompt را کوتاه کنید: بخشهای تزئینی و توضیح دوباره تصویر را حذف کنید.
- حرکت را ساده کنید: فقط یک کنش اصلی و یک حرکت دوربین نگه دارید.
- تصویر ورودی را اصلاح کنید: اگر دست یا چهره در Keyframe ایراد دارد، ویدیو آن را نجات نمیدهد.
- از Motion Reference استفاده کنید: برای پشتک، رقص یا اکشن انسانی پیچیده، ویدیوی مرجع حرکت میتواند Physics را بهتر هدایت کند.
- مدل را عوض کنید: اگر یک شات پس از چند تلاش همچنان خراب است، ادامه Generate در همان مدل فقط هزینه را بالا میبرد.
فریم اول و آخر کافی نیست؛ فریمهای میانی را هم ببینید. بسیاری از تغییر شکلهای چهره، انگشت یا لوگو فقط برای چند فریم رخ میدهند.
بهترین ابزار تبدیل عکس به ویدیو برای هر بودجه
هیچ ابزار واحدی برای همه شاتها بهترین نیست. انتخابهای زیر تجربهمحور هستند و با نسخههای جدید باید دوباره تست شوند.
بودجه پایین: Wan 2.2 و LTX‑۲.۳ روی ComfyUI
برای تمرین و کار Local، دو انتخاب قابلبررسی Wan 2.2 TI2V 5B و LTX‑۲.۳ هستند. Wan مسیر رسمی Image-to-Video و Workflow بومی ComfyUI دارد. LTX‑۲.۳ نیز مدل Open-source و Workflow رسمی Image-to-Video ارائه میکند.
مدل Local الزاماً «بیهزینه» نیست؛ کارت گرافیک، VRAM، فضای ذخیرهسازی، برق و زمان رندر هزینه واقعیاند. مزیت اصلی، تمرین زیاد، کنترل Workflow و نپرداختن هزینه برای هر Generation است. قبل از دانلود، نیاز سختافزاری نسخه و Workflow را از مستندات رسمی بررسی کنید.
بودجه متوسط: Kling
انتخاب عملی معین برای بسیاری از شاتهای بودجه متوسط Kling است. ابتدا سختترین شات را تست کنید؛ اگر حرکت دوربین، چهره و جزئیات ضروری قابلقبول بود، اعتبار پروژه را روی همان Workflow مصرف کنید.
بودجه بالا: Seedance 2 و Seedance 2.5
برای پروژه حرفهای و شاتهای پیچیده، Seedance انتخاب اول معین است. در نسخه ۲.۵ امکان طراحی Multi-shot طولانیتر و استفاده از مرجعهای چندرسانهای مطرح شده است. در تجربه اخیر او، میتوان سناریوی چندشاتی تا حدود ۳۰ ثانیه را یکپارچه تولید کرد و سپس قسمتهای ضعیف را در تدوین حذف یا دوباره Generate کرد.
برای مقایسه گستردهتر مدلها، مقاله بهترین هوش مصنوعی ساخت ویدیو در ۲۰۲۶ را ببینید.
ابزار رایگان چه زمانی کافی است؟
برای یادگیری Prompt، تست حرکت و تمرین Workflow لازم نیست از روز اول اشتراک گران بخرید. اعتبارهای آزمایشی و مدل Local برای این مرحله کافیاند. اما پروژه مشتری به چند Take، سرعت، ثبات، رزولوشن مناسب و امکان اصلاح نیاز دارد؛ بنابراین باید هزینه سرویس حرفهای را جزو بودجه تولید حساب کرد.
برای کاربران ایرانی، پرداخت دلاری و دسترسی منطقهای ممکن است مشکلساز باشد. پلتفرم ASOON.ai در حال آمادهسازی دسترسی سادهتر است؛ در زمان نگارش، سایت قابلمشاهده است اما امکان Generate عمومی هنوز فعال نشده، بنابراین برای شروع پروژه روی آن حساب قطعی باز نکنید.
برای ریلز، تبلیغ و موزیکویدیو چه تنظیمی مناسب است؟
- ریلز: از ابتدا ۹:۱۶، سوژه در Safe Area و شاتهای کوتاه با Hook واضح.
- تبلیغ محصول: شکل، نوشته و رنگ محصول مهمتر از حرکت نمایشی دوربین است.
- موزیکویدیو: شاتها میتوانند جسورانهتر باشند، اما حرکت باید با موسیقی و تدوین ارتباط داشته باشد.
معین معمولاً شاتهای حدود پنجثانیهای تولید و آنها را در تدوین به ویدیوی بلندتر تبدیل میکند. شات کوتاه، انتخاب Take و کنترل ریتم را آسانتر میکند. Multi-shot سیثانیهای زمانی ارزش دارد که پیوستگی شخصیت، لوکیشن یا دیالوگ مهم باشد و مدل مناسب در دسترس باشد.
یک پروژه واقعی چگونه ساخته میشود؟
در موزیکویدیوی «صحنه ۲» سیاوش شمس و تیزرهای البرکا و براق، تیم ریکولی ابتدا تصاویر پروژه را ساخت. عکسها کنار هم بررسی شدند تا روایت، رنگ و ریتم بصری تأیید شود؛ سپس تصاویر منتخب به ویدیو تبدیل شدند. کلیپهای نهایی در Premiere و DaVinci تدوین، صداگذاری و اصلاح شدند.
این تفاوت مهم است: پروژه حرفهای مجموعهای از Generationهای پراکنده نیست. تصویرسازی، انتخاب Take، تدوین، Sound Design و Color یک زنجیره واحد هستند. برای دیدن مسیر پروژههای تجاری، به راهنمای ساخت تبلیغ و موزیکویدیو با هوش مصنوعی و خدمات تولید محتوای ریکولی سر بزنید.
چهار اشتباه رایج مبتدیها
- Prompt طولانی: مدل عکس را میبیند؛ لازم نیست همه اجزای آن را دوباره توصیف کنید.
- حرکتهای زیاد: چند کنش و حرکت دوربین متناقض، Physics و چهره را خراب میکند.
- Keyframe بیجان: تصویر کاملاً Static شروع طبیعی حرکت را دشوار میکند.
- انتظار خروجی نهایی از مدل: ویدیوی خام هنوز به تدوین، صدا، رنگ و کنترل خطا نیاز دارد.
اگر هدف شما محتوای عمودی است، راهنمای ساخت ریلز با هوش مصنوعی سناریو، Character Sheet، صدا و خروجی اینستاگرام را کاملتر توضیح میدهد.
این Workflow را پروژهمحور یاد بگیرید
نام مدلها عوض میشود، اما مهارت دیدن حرکت، طراحی Keyframe، نوشتن Prompt، ساخت Reference، تشخیص فریم خراب و تدوین نتیجه ماندگار است. در دوره ساخت تصویر و ویدیو با هوش مصنوعی ریکولی مسیر Image-to-Video و اجرای پروژه آموزش داده شده است؛ پروژه نوشیدنی براق یکی از نمونههای پروژهمحور این بخش است و آموزشها با ابزارهای جدید بهروزرسانی میشوند.
مشاهده سرفصلها و ثبتنام دوره هوش مصنوعی
سؤالات متداول
آیا میتوان با گوشی عکس را به ویدیو تبدیل کرد؟
بله. بسیاری از سرویسها در مرورگر موبایل یا اپ اجرا میشوند و تدوین ساده را میتوان با CapCut یا InShot انجام داد. Workflow حرفهای ریکولی بیشتر روی کامپیوتر، Premiere و DaVinci انجام میشود.
بهترین Prompt برای تبدیل عکس به ویدیو چیست؟
Prompt ثابت و جادویی وجود ندارد. حرکت دوربین، کنش سوژه و حرکت ضروری محیط را کوتاه و روشن بنویسید. ظاهر صحنهای را که در عکس دیده میشود دوباره توضیح ندهید.
چرا چهره بعد از متحرکسازی تغییر میکند؟
حرکت پیچیده، تصویر اولیه ضعیف یا مدل نامناسب از علتهای رایج هستند. حرکت را ساده کنید، Keyframe سالمتری بسازید و فریمهای میانی چند Take را مقایسه کنید.
آیا ابزارهای رایگان برای پروژه مشتری مناسباند؟
برای تمرین مناسباند، اما پروژه مشتری معمولاً به سرعت، چند Take، رزولوشن، ثبات و مجوز تجاری نیاز دارد. شرایط استفاده و پلن همان ابزار را پیش از تحویل بررسی کنید.
Wan بهتر است یا LTX؟
به GPU، زمان رندر، نوع حرکت و Workflow شما بستگی دارد. هر دو مسیر رسمی Image-to-Video و ComfyUI دارند. یک تصویر و Prompt مشترک را روی هر دو اجرا کنید و نرخ Take قابلاستفاده را مقایسه کنید.
برای Image-to-Video شات پنجثانیهای بهتر است یا سیثانیهای؟
برای بیشتر پروژهها، شاتهای کوتاه کنترل و تدوین آسانتری دارند. خروجی طولانی برای Multi-shot و پیوستگی روایت مفید است، اما هزینه خطا هم بیشتر میشود.
دیدگاهتان را بنویسید