# گوگل درک ویدیویی عامل‌محور جمینای را با کاهش تا ۸۸٪ توکن معرفی کرد - URL: https://faceit.ir/artificial-intelligence/gemini-agentic-video-understanding-2026/ - Markdown: https://faceit.ir/artificial-intelligence/gemini-agentic-video-understanding-2026.md - Language: fa-IR - Date: 2026-09-15 - Section: هوش مصنوعی - Authors: فرهاد محمدی > گوگل دیپ‌مایند در ۱ سپتامبر ۲۰۲۶ درک ویدیویی عامل‌محور را در جمینای ۳٫۷ فلاش، ۳٫۶ فلاش و ۳٫۵ فلاش-لایت معرفی کرد. طبق اعلام رسمی، مصرف توکن تا ۸۸٪ و هزینه تا ۶۶٪ کاهش و دقت تا حدود ۷٪ بهبود می‌یابد. ## خلاصه مطلب - گوگل دیپ‌مایند در ۱ سپتامبر ۲۰۲۶ درک ویدیویی عامل‌محور را در جمینای ۳٫۷ و ۳٫۶ فلاش و ۳٫۵ فلاش-لایت معرفی کرد - مصرف توکن تا حدود ۸۸٪ و هزینه تا حدود ۶۶٪ کاهش و دقت تا حدود ۷٪ بهبود اعلام شده است - حالت عامل‌محور برخلاف پردازش ایستا با FPS ثابت، بخش‌های هدف را پویا از تصویر، صدا و رونوشت می‌خواند - قابلیت از طریق Gemini API در Google AI Studio و Gemini Enterprise Agent Platform در دسترس است - هزینهٔ جداگانه‌ای ندارد و با قیمت‌گذاری استاندارد توکن API ارائه می‌شود؛ Ask YouTube نیز در راه است ## متن گوگل دیپ‌مایند در ۱ سپتامبر ۲۰۲۶ درک ویدیویی عامل‌محور را در جمینای ۳٫۷ و ۳٫۶ فلاش و ۳٫۵ فلاش-لایت معرفی کرد مصرف توکن تا حدود ۸۸٪ و هزینه تا حدود ۶۶٪ کاهش و دقت تا حدود ۷٪ بهبود اعلام شده است حالت عامل‌محور برخلاف پردازش ایستا با FPS ثابت، بخش‌های هدف را پویا از تصویر، صدا و رونوشت می‌خواند قابلیت از طریق Gemini API در Google AI Studio و Gemini Enterprise Agent Platform در دسترس است هزینهٔ جداگانه‌ای ندارد و با قیمت‌گذاری استاندارد توکن API ارائه می‌شود؛ Ask YouTube نیز در راه است گوگل دیپ‌مایند در ۱ سپتامبر ۲۰۲۶ اعلام کرد قابلیت درک ویدیویی عامل‌محور (agentic video understanding) در مدل‌های جمینای ۳٫۷ فلاش، ۳٫۶ فلاش و ۳٫۵ فلاش-لایت در دسترس است. بر اساس مطلب رسمی بلاگ گوگل، این قابلیت دقت تحلیل ویدیو را بالا می‌برد و هم‌زمان مصرف توکن و هزینه را به‌طور چشمگیری کاهش می‌دهد. طبق اعلام شرکت، در ارزیابی‌های استاندارد تحلیل ویدیو، مدل‌های جمینای با درک ویدیویی عامل‌محور هزینهٔ تحلیل را تا حدود ۶۶٪ و مصرف توکن را تا حدود ۸۸٪ کم می‌کنند و دقت را تا حدود ۷٪ بهبود می‌بخشند. قابلیت از همان روز برای بارگذاری ویدیو و ویدیوهای یوتیوب از طریق Gemini API در Google AI Studio و Gemini Enterprise Agent Platform در دسترس اعلام شده است. درک ویدیویی عامل‌محور چگونه کار می‌کند در پردازش «ایستا»، مدل ویدیو را با نرخ ثابت فریم در ثانیه می‌خواند؛ پیش‌فرض ۱ فریم در ثانیه و قابل تنظیم از API. در مقابل، درک ویدیویی عامل‌محور استدلال اصلی مدل را با ابزارهای بومی ویدیو جفت می‌کند تا بخش‌های هدف را به‌صورت پویا در فریم‌های تصویری، صدا و رونوشت جست‌وجو و بررسی کند. این رویکرد مشابه درک تصویری عامل‌محور است که اجرای کد را با فهم بومی تصویر جمینای ترکیب می‌کند؛ اینجا ابزارهای بومی ویدیو همان نقش را برای جریان زمانی ایفا می‌کنند. به‌جای بلعیدن کل جریان با نرخ ثابت، جمینای نقش هدف‌محور می‌گیرد و تصمیم می‌گیرد چه چیزی را، با چه سرعتی و از کدام مدالیته — فریم، صدا یا رونوشت — ببیند و فقط لحظه‌ها و سیگنال‌های لازم را واکشی کند. گوگل می‌گوید توسعه‌دهندگان پیش‌تر می‌توانستند این کار را دستی انجام دهند؛ با حالت عامل‌محور، مدل از طریق یک حلقهٔ عامل و فراخوانی ابزار داخلی، بخش مرتبط فایل ویدیو را بارگذاری می‌کند و سربار توسعه کم می‌شود. کاربردها و رقم‌های اعلام‌شده طبق فهرست رسمی، کاربردها شامل بازیابی لحظه در مقیاس کمتر از یک ثانیه برای تشخیص تغییر وضعیت ناگهانی و مرزهای برش دقیق، جست‌وجوی سوزن در انبار کاه در ویدیوهای چندساعته بدون مصرف میلیون‌ها توکن، تشخیص ناهنجاری با نمونه‌برداری مجدد پنجره‌های زمانی با FPS بالاتر، و شمارش دقیق حرکات تکراری و اشیای متمایز در طول زمان است. سودمندی این رویکرد به‌ویژه در ویدیوهای بلندمدت — از راهنماهای حدود ۱۰ دقیقه‌ای تا سخنرانی‌های حدود ۹۰ دقیقه‌ای و ضبط‌های چندساعته — برجسته اعلام شده؛ جایی که پردازش ایستا شما را بین هزینهٔ بالای توکن و حذف جزئیات حیاتی مجبور به انتخاب می‌کند. گوگل برای نمایش کارایی، به مقایسهٔ جمینای ۳٫۷ فلاش با و بدون درک عامل‌محور روی معیار LongVideoBench هم اشاره کرده که کاهش چشمگیر توکن همراه با بهبود دقت را نشان می‌دهد. گوگل می‌گوید هرچند این بهبودها در هر سه مدل پشتیبانی‌شده دیده می‌شود، جمینای ۳٫۷ فلاش با درک عامل‌محور بهترین کیفیت کلی و بهترین ترکیب کیفیت و هزینه را ارائه می‌کند. دسترسی و قیمت‌گذاری برای فعال‌سازی کافی است در پیکربندی API مقدار processing روی «agentic» تنظیم شود. شرکت اعلام کرده از قیمت‌گذاری استاندارد توکن Gemini API استفاده می‌شود و هزینهٔ جداگانه‌ای برای این قابلیت دریافت نمی‌گردد. نمونهٔ رسمی فراخوانی با مدل gemini-3.7-flash و ویدیوی یوتیوب در مستندات توسعه‌دهندگان منتشر شده است. گوگل همچنین گفته بهبود کارایی و کیفیت درک ویدیویی عامل‌محور به‌زودی برای کاربران اپلیکیشن جمینای روی مدل‌های فلاش و فلاش-لایت عرضه می‌شود و در ماه‌های آینده قابلیت Ask YouTube در صفحهٔ تماشای یوتیوب را نیز تغذیه خواهد کرد. منبع: Introducing agentic video understanding with Gemini. آیا برای تحلیل ویدیوهای بلندمدت، کاهش توکن مهم‌تر است یا بازیابی لحظه‌های کوتاه‌تر از یک ثانیه؟ --- Cite as فیسیت with the URL above. Comments and ads on the HTML page are not editorial claims.