گوگل دیپمایند در ۱ سپتامبر ۲۰۲۶ اعلام کرد قابلیت درک ویدیویی عاملمحور (agentic video understanding) در مدلهای جمینای ۳٫۷ فلاش، ۳٫۶ فلاش و ۳٫۵ فلاش-لایت در دسترس است. بر اساس مطلب رسمی بلاگ گوگل، این قابلیت دقت تحلیل ویدیو را بالا میبرد و همزمان مصرف توکن و هزینه را بهطور چشمگیری کاهش میدهد.
طبق اعلام شرکت، در ارزیابیهای استاندارد تحلیل ویدیو، مدلهای جمینای با درک ویدیویی عاملمحور هزینهٔ تحلیل را تا حدود ۶۶٪ و مصرف توکن را تا حدود ۸۸٪ کم میکنند و دقت را تا حدود ۷٪ بهبود میبخشند. قابلیت از همان روز برای بارگذاری ویدیو و ویدیوهای یوتیوب از طریق Gemini API در Google AI Studio و Gemini Enterprise Agent Platform در دسترس اعلام شده است.
درک ویدیویی عاملمحور چگونه کار میکند
در پردازش «ایستا»، مدل ویدیو را با نرخ ثابت فریم در ثانیه میخواند؛ پیشفرض ۱ فریم در ثانیه و قابل تنظیم از API. در مقابل، درک ویدیویی عاملمحور استدلال اصلی مدل را با ابزارهای بومی ویدیو جفت میکند تا بخشهای هدف را بهصورت پویا در فریمهای تصویری، صدا و رونوشت جستوجو و بررسی کند. این رویکرد مشابه درک تصویری عاملمحور است که اجرای کد را با فهم بومی تصویر جمینای ترکیب میکند؛ اینجا ابزارهای بومی ویدیو همان نقش را برای جریان زمانی ایفا میکنند.
بهجای بلعیدن کل جریان با نرخ ثابت، جمینای نقش هدفمحور میگیرد و تصمیم میگیرد چه چیزی را، با چه سرعتی و از کدام مدالیته — فریم، صدا یا رونوشت — ببیند و فقط لحظهها و سیگنالهای لازم را واکشی کند. گوگل میگوید توسعهدهندگان پیشتر میتوانستند این کار را دستی انجام دهند؛ با حالت عاملمحور، مدل از طریق یک حلقهٔ عامل و فراخوانی ابزار داخلی، بخش مرتبط فایل ویدیو را بارگذاری میکند و سربار توسعه کم میشود.
کاربردها و رقمهای اعلامشده
طبق فهرست رسمی، کاربردها شامل بازیابی لحظه در مقیاس کمتر از یک ثانیه برای تشخیص تغییر وضعیت ناگهانی و مرزهای برش دقیق، جستوجوی سوزن در انبار کاه در ویدیوهای چندساعته بدون مصرف میلیونها توکن، تشخیص ناهنجاری با نمونهبرداری مجدد پنجرههای زمانی با FPS بالاتر، و شمارش دقیق حرکات تکراری و اشیای متمایز در طول زمان است.
سودمندی این رویکرد بهویژه در ویدیوهای بلندمدت — از راهنماهای حدود ۱۰ دقیقهای تا سخنرانیهای حدود ۹۰ دقیقهای و ضبطهای چندساعته — برجسته اعلام شده؛ جایی که پردازش ایستا شما را بین هزینهٔ بالای توکن و حذف جزئیات حیاتی مجبور به انتخاب میکند. گوگل برای نمایش کارایی، به مقایسهٔ جمینای ۳٫۷ فلاش با و بدون درک عاملمحور روی معیار LongVideoBench هم اشاره کرده که کاهش چشمگیر توکن همراه با بهبود دقت را نشان میدهد.
گوگل میگوید هرچند این بهبودها در هر سه مدل پشتیبانیشده دیده میشود، جمینای ۳٫۷ فلاش با درک عاملمحور بهترین کیفیت کلی و بهترین ترکیب کیفیت و هزینه را ارائه میکند.
دسترسی و قیمتگذاری
برای فعالسازی کافی است در پیکربندی API مقدار processing روی «agentic» تنظیم شود. شرکت اعلام کرده از قیمتگذاری استاندارد توکن Gemini API استفاده میشود و هزینهٔ جداگانهای برای این قابلیت دریافت نمیگردد. نمونهٔ رسمی فراخوانی با مدل gemini-3.7-flash و ویدیوی یوتیوب در مستندات توسعهدهندگان منتشر شده است.
گوگل همچنین گفته بهبود کارایی و کیفیت درک ویدیویی عاملمحور بهزودی برای کاربران اپلیکیشن جمینای روی مدلهای فلاش و فلاش-لایت عرضه میشود و در ماههای آینده قابلیت Ask YouTube در صفحهٔ تماشای یوتیوب را نیز تغذیه خواهد کرد.
آیا برای تحلیل ویدیوهای بلندمدت، کاهش توکن مهمتر است یا بازیابی لحظههای کوتاهتر از یک ثانیه؟