فهرست مطالب
گوگل مدل هوش مصنوعی Gemini Omni 1.1 Flash را با مجموعهای از قابلیتهای پیشرفته برای تولید و ویرایش ویدیو معرفی کرد.
به گزارش سرویس هوش مصنوعی تکناک، این مدل میتواند صحنههای موجود را ادامه دهد، ویدیوی پیوسته میان فریم اول و آخر بسازد، از ویدیوهای مرجع استفاده کند و خروجیهایی با وضوح 1080p و 4K ارائه دهد. گوگل همچنین با اضافه کردن حالت 360p، امکان ساخت سریعتر و ارزانتر پیشنمایشهای ویدیویی را برای توسعهدهندگان فراهم کرده است.
مدل هوش مصنوعی Gemini Omni 1.1 Flash با تمرکز بر افزایش کنترل کاربران روی فرایند تولید ویدیو توسعه یافته است. گوگل میگوید قابلیتهای جدید، Omni 1.1 را برای استفاده حرفهای و محیطهای تولیدی آماده میکنند. توسعهدهندگان میتوانند این مدل را از طریق Gemini API در Google AI Studio به کار بگیرند و قابلیتهای آن را در ابزارهای تولید محتوا، نرمافزارهای ویرایش رسانه و گردشکارهای مبتنی بر هوش مصنوعی ادغام کنند.
بیشتر بخوانید: گوگل ابزار جدید Omni را برای تولید ویدیو به جمنای اضافه می کند
ادامه صحنهها تا ویدیوهای ۴۰ ثانیهای
گوگل میگوید یکی از مهمترین قابلیتهای Gemini Omni 1.1 Flash، امکان توسعه صحنه یا Scene Extension است. این ویژگی به کاربر اجازه میدهد یک ویدیوی موجود را از نقطه پایان آن ادامه دهد و محتوای جدیدی تولید کند که از نظر بصری و روایی با بخش قبلی هماهنگ باشد.
Omni 1.1 برای انجام این کار میتواند حداکثر ۱۰ ثانیه از محتوای قبلی ویدیو را تحلیل کند. مدلهای قبلی تنها به یک ثانیه پایانی ویدیو مراجعه میکردند. افزایش این محدوده به مدل کمک میکند شخصیتها، محیط، حرکت دوربین و روند داستان را بهتر درک کند و هنگام تولید ادامه صحنه، هماهنگی بیشتری با محتوای قبلی داشته باشد.
کاربران میتوانند هر بار ۱۰ ثانیه به ویدیوی خود اضافه کنند و در نهایت طول تجمعی آن را به ۴۰ ثانیه برسانند. این قابلیت میتواند برای ساخت روایتهای طولانیتر یا هدایت یک صحنه به مسیرهای متفاوت مورد استفاده قرار گیرد.
نمونههای منتشرشده از سوی گوگل نشان میدهند که توسعه صحنه فقط به اضافه کردن چند ثانیه تصویر محدود نیست. کاربران میتوانند با پرامپتهای متنی، نحوه ادامه داستان، دیالوگ شخصیتها، محیط و حتی نوع حرکت دوربین را تعیین کنند.
برای مثال، در یکی از نمونهها دوربین کمی حرکت میکند و مردی با موهای فر در کنار شخصیت اصلی ظاهر میشود. در ادامه، کاربر میتواند از مدل بخواهد دوربین عقب برود و دخمههایی قدیمی و غبارآلود را نشان دهد. همین صحنه در مرحله بعد میتواند به کتابخانهای بزرگ برسد که کتابها و قفسههای آن در فضایی غبارآلود و بیوزن شناور هستند.
کنترل حرکت دوربین نیز بخش مهم دیگری از این قابلیت است. Omni 1.1 میتواند دستورهایی برای اجرای حرکات سینمایی پیچیده دریافت کند. در یکی از نمونهها، مدل حرکت «دالی زوم» را اجرا میکند. دوربین به جلو حرکت میکند و همزمان زوم کاهش مییابد تا اندازه چهره شخصیت ثابت بماند و پرسپکتیو محیط پشت سر او بهشدت تغییر کند.
در نمونه دیگری، زمان در صحنه کاملاً متوقف میشود و شخصیت و لباس او ثابت باقی میمانند. دوربین سپس با سرعت بالا، یک چرخش نرم ۳۶۰ درجهای در اطراف شخصیت انجام میدهد و عمق سهبعدی محیط را نمایش میدهد.
Gemini Omni 1.1 Flash همچنین میتواند دیالوگها را در ادامه ویدیو حفظ کند. گوگل نمونهای را نمایش داده است که شخصیت داستان درباره پدر خود و خاطرات مربوط به یک بندر صحبت میکند و مدل همزمان با ادامه گفتوگو، حرکت پیوسته دوربین و موسیقی صحنه را نیز حفظ میکند.

ساخت ویدیو میان فریم اول و آخر
قابلیت مهم دیگر Omni 1.1، امکان تعیین فریم آغازین و پایانی یک نما است. کاربر میتواند دو تصویر را بهعنوان نقطه شروع و پایان مشخص کند و مدل، ویدیوی پیوسته میان این دو فریم را تولید میکند.
این ویژگی میتواند برای ایجاد انتقالهای نرم میان صحنهها، حرکت دوربین به دور سوژه، زومهای پیچیده یا ساخت کلیپهایی که بهشکل یک حلقه پیوسته تکرار میشوند، کاربرد داشته باشد.
در یکی از نمونههای گوگل، صحنه با نمای نزدیک و زاویه پایین از نوازندهای با کتوشلوار بژ آغاز میشود که یک مجموعه درام قرمز را مینوازد. دوربین سپس با حرکتی سریع به سمت دیگر میچرخد و نوازنده سالخورده ساکسیفون و یک رقصنده باله را زیر نورهای بنفش نمایش میدهد. تمام این اتفاقها در یک نمای پیوسته و بدون برش رخ میدهند.
نمونه دیگری با زوم دوربین به داخل صفحه تلویزیون انجام میشود. کاربر از مدل میخواهد همان زن و همان صحنه ابتدای ویدیو را داخل تلویزیون نمایش دهد تا ویدیو بدون پرش یا برش به نقطه آغاز خود بازگردد.
این قابلیت میتواند به سازندگان محتوا اجازه دهد مسیر حرکت دوربین و نتیجه نهایی یک نما را با دقت بیشتری تعیین کنند. در نتیجه، مدل بهجای تصمیمگیری کامل درباره مسیر ویدیو، باید میان دو نقطه مشخصشده از سوی کاربر حرکت مناسبی ایجاد کند.
پیشنمایش 360p و خروجی حرفهای 4K
گوگل برای سرعت بخشیدن به فرایند آزمون و خطا، امکان تولید ویدیوهای آزمایشی با وضوح 360p را به Omni 1.1 اضافه کرده است. این پیشنمایشها در مقایسه با ویدیوهای استاندارد 720p این مدل، تا ۶۰ درصد سریعتر تولید میشوند و هزینه تولید آنها نیز به حدود یکسوم میرسد.
به گفته گوگل، این ویژگی برای نمونهسازی سریع، آزمایش استوریبوردها و بررسی ایدههای مختلف پیش از تولید نسخه نهایی طراحی شده است. توسعهدهندگان و سازندگان محتوا میتوانند ابتدا چند نسخه سبک از یک ایده بسازند و پس از انتخاب نمونه مناسب، نسخه نهایی را با وضوح بالاتر تولید کنند.
گوگل مفهومی با عنوان «Draft Room» را نیز برای نمایش یکی از کاربردهای این قابلیت مطرح کرده است. سازندگان محتوا معمولاً پیش از رسیدن به نتیجه مورد نظر، چندین نسخه از یک ویدیو را تولید میکنند. در Draft Room میتوان سه یا چهار نسخه آزمایشی 360p ایجاد کرد و در هر نسخه فقط یک عامل را تغییر داد. کاربر سپس میتواند خروجیها را در کنار یکدیگر مقایسه کند.
در سوی دیگر این فرایند، Gemini Omni 1.1 Flash از تولید خروجیهای 1080p و 4K پشتیبانی میکند. این قابلیت به کاربران اجازه میدهد پس از پایان مرحله آزمایش، نسخهای با وضوح بالا و مناسب برای تولیدات حرفهای دریافت کنند.
گوگل برای نمایش کیفیت این قابلیت، نمونههایی شامل ماهیهای در حال شنا، حرکت یک سنجاب در محیط جنگلی و نمای ماکرو از برگهای افرا ژاپنی منتشر کرده است. در نمونه برگهای افرا، مدل باید جزئیاتی مانند حرکت آرام برگها در نسیم، عبور نور خورشید از آنها، عمق میدان کم، پسزمینه بوکه و بافتهای واقعگرایانه را در وضوح 4K حفظ کند.
بیشتر بخوانید: سرویس Google Vids به Gemini Omni مجهز شد
استفاده از ویدیوی مرجع برای حفظ هماهنگی
Gemini Omni 1.1 Flash امکان استفاده از ویدیوی مرجع را نیز به ورودی چندوجهی اضافه میکند. کاربران میتوانند حداکثر سه ثانیه ویدیو را بهعنوان مرجع در اختیار مدل قرار دهند تا Omni هنگام ساخت صحنه جدید، اطلاعات حرکتی و بصری آن را در نظر بگیرد.
این قابلیت میتواند برای حفظ هماهنگی شخصیتها و انتقال حرکت از یک ویدیوی مرجع به شخصیت دیگری مورد استفاده قرار گیرد.
گوگل در یکی از نمونهها سه ویدیوی رقص را همراه با تصاویر سه شخصیت در اختیار مدل قرار میدهد. سپس از Omni خواسته میشود حرکات هر رقصنده را به یکی از شخصیتها منتقل کند. شخصیت سگ رقص کلاسیک، اختاپوس رقص هیپهاپ و خرس حرکات بریکدنس را اجرا میکنند.
مدل باید هر سه شخصیت را بهطور همزمان در فضای مشخصشده در تصویر مرجع قرار دهد و نتیجه را در قالب یک نمای پیوسته و بدون برش تولید کند. این نمونه نشان میدهد که توسعهدهندگان میتوانند چند نوع ورودی شامل متن، تصویر و ویدیو را برای هدایت دقیقتر تولید محتوا ترکیب کنند.
گوگل کاربردهای دیگری را نیز برای این قابلیتها مطرح کرده است. یکی از نمونهها به ابزارهای نمایش املاک مربوط میشود. مدل میتواند دوربین را میان اتاقهای یک خانه حرکت دهد، به سوژه نزدیک یا از آن دور شود و فضای خانه را در زمان مناسبی از روز نمایش دهد. در عین حال، مدل نباید مبلمان یا جزئیاتی را که در تصاویر اصلی وجود ندارند، به محیط اضافه کند.
استفاده ادوبی، Figma و Runway از Omni Flash
برخی شرکتهای فعال در حوزه ابزارهای خلاقانه نیز استفاده از Gemini Omni Flash را آغاز کردهاند. ادوبی این مدل را در ادوبی Firefly ادغام کرده است و از قابلیتهای آن برای ویرایش ویدیو بهره میبرد.
Figma Weave نیز Omni Flash را یکی از مدلهای قدرتمند ویدیویی موجود در پلتفرم خود توصیف کرده است. ایتای شیف، مدیر خلاق Figma Weave، میگوید قابلیتهایی مانند توسعه ویدیو، استفاده از منابع مرجع غنیتر و وضوح 4K باعث میشوند تیمهای خلاق از تولید ساده ویدیو فراتر بروند و کنترل بیشتری شبیه فرایند کارگردانی بر خروجی داشته باشند.
GMI Cloud نیز دقت مدل را یکی از مهمترین ویژگیهای آن میداند. لوییزا گوئو، معاون بازاریابی این شرکت، اعلام کرده است که حفظ جزئیات برای مشتریانی که محتوای آموزشی و توضیحی تولید میکنند اهمیت زیادی دارد. به گفته او، قابلیت اطمینان Omni باعث شده است تولید ویدیو با هوش مصنوعی برای گروهی از کاربران قابل استفاده شود که پیشتر نمیتوانستند به خروجی چنین مدلهایی اتکا کنند.
Runway نیز Omni Flash را با شیوه فعلی کار کاربران خود سازگار میداند. کاربران این پلتفرم میتوانند فرایند تولید را با یک پرامپت، تصویر یا ویدیو آغاز کنند و سپس همان محتوا را توسعه دهند یا ویرایش کنند.
بیشتر بخوانید: گوگل دسترسی رایگان به ابزار تولید ویدیوی Gemini Omni را تمدید کرد
عرضه Omni 1.1 در اکوسیستم گوگل
گوگل عرضه Gemini Omni 1.1 Flash را از ۲۷ اوت در اکوسیستم توسعهدهندگان خود آغاز کرده است. توسعهدهندگان میتوانند مدل را مستقیماً در Google AI Studio آزمایش کنند و از طریق Gemini API در برنامههای خود به کار بگیرند.
شرکتها نیز میتوانند از Omni 1.1 از طریق Agent Platform API در Gemini Enterprise Agent Platform استفاده کنند. گوگل مستندات رسمی، نمونههای کدنویسی و راهنمای پرامپتنویسی را برای پیادهسازی قابلیتهایی مانند توسعه صحنه، استفاده از ویدیوی مرجع و ارتقای وضوح منتشر کرده است.
مدل Gemini Omni 1.1 Flash از زمان معرفی برای مشترکان Google AI Plus، Pro و Ultra در سراسر جهان از طریق Google Flow نیز در دسترس قرار گرفته است. قابلیت توسعه صحنه نیز برای مشترکان این سه طرح در اپلیکیشن Gemini عرضه شده است.
مجموع قابلیتهای جدید نشان میدهد گوگل در Omni 1.1 Flash تنها روی افزایش کیفیت تولید ویدیو تمرکز نکرده و کنترل سازندگان بر روند تولید را نیز گسترش داده است. امکان تعیین ابتدا و انتهای نما، ادامه صحنه با درک ۱۰ ثانیه از محتوای قبلی، استفاده از ویدیوی مرجع، تولید نسخههای آزمایشی سریع و دریافت خروجی 4K، این مدل را به ابزاری برای ساخت و ویرایش کنترلشدهتر ویدیوهای مبتنی بر هوش مصنوعی تبدیل میکند.
















