موبایل و فناوری

Gemini 3.8 Live آمد؛ مکالمه صوتی گوگل هم‌زمان فکر می‌کند و حرف می‌زند

گوگل دو مدل صوتی Gemini 3.8 Live را عرضه کرده است؛ یکی سریع و اقتصادی، دیگری برای استدلال چندمرحله‌ای. قابلیت‌ها، قیمت و محدودیت‌های واقعی را بررسی می‌کنیم.

مردی با هدفون بی‌سیم و گوشی در حال مکالمه صوتی در فضای شهری

دستیار صوتی وقتی واقعاً مفید می‌شود که فقط منتظر تمام‌شدن جمله نماند: باید حرف کاربر را بفهمد، در میانه مکالمه ابزار لازم را اجرا کند و بدون سکوت طولانی نتیجه را برگرداند. گوگل در ۱۵ سپتامبر ۲۰۲۶ دو مدل تازه برای همین مسئله معرفی کرد: Gemini 3.8 Live و Gemini 3.8 Live Extended Thinking.

نسخه پایه برای مکالمه روان و هزینه کمتر ساخته شده؛ Extended Thinking هنگام صحبت، استدلال چندمرحله‌ای و فراخوانی ابزارها را در پس‌زمینه ادامه می‌دهد. عرضه در Gemini API و AI Studio آغاز شده و به Gemini Live، Search Live و Workspace می‌رسد، اما دسترسی به کشور، زبان و نوع اشتراک بستگی دارد.

دو مدل برای دو نوع مکالمه

Gemini 3.8 Live مدل سریع‌تر و اقتصادی‌تر خانواده است. طبق توضیح گوگل، ورودی صوتی و تصویری را نزدیک به زمان واقعی پردازش می‌کند، میان زبان‌های پشتیبانی‌شده جابه‌جا می‌شود و هنگام ادامه گفتگو ابزار یا API را صدا می‌زند. دستیار خرید، راهنمای عیب‌یابی و آموزش تعاملی کاربردهای روشن آن هستند.

Gemini 3.8 Live Extended Thinking برای کارهای پیچیده‌تر است. مدل می‌تواند با جمله‌ای مانند «اجازه بده بررسی کنم» پاسخ اولیه بدهد و هم‌زمان استدلال و کار چندمرحله‌ای را پیش ببرد؛ کاربر برای هر فراخوانی ابزار مجبور به تحمل سکوت کامل نیست.

این معماری البته تضمین نمی‌کند هر پاسخ سریع یا درست باشد. کارت مدل رسمی هر دو نسخه را مبتنی بر Gemini 3 Pro معرفی می‌کند و صریحاً از احتمال توهم، کندی و پایان‌زمان نام می‌برد. تاریخ قطع دانش مدل ژانویه ۲۰۲۵ است؛ بنابراین برای اطلاعات جدید باید به جست‌وجو یا منبع بیرونی متکی باشد.

نمای نزدیک میکروفن استودیویی برای ضبط و پردازش گفتار
عکس توضیحی از یک میکروفن استودیویی؛ تصویر محصول یا آزمایش Gemini نیست. عکس: Clement Lepetit / Pexels؛ منبع ۱۶ سپتامبر ۲۰۲۲، دسترسی ۱۶ سپتامبر ۲۰۲۶.

«هم‌زمان فکرکردن و حرف‌زدن» در عمل چه معنایی دارد؟

مستندات فنی گوگل هشدار می‌دهد که دریافت turnComplete: true دیگر لزوماً به معنی بیکارشدن مدل نیست. برنامه باید پیام‌های بعدی، فریم‌های صوتی یا درخواست ابزار را همچنان گوش کند و وضعیت واقعی را از interaction_status بخواند. در این مدل فقط فراخوانی تابع ناهمگام و غیرمسدودکننده پشتیبانی می‌شود؛ حالت همگام خطای سخت می‌دهد.

سطح استدلال روی کم، متوسط یا زیاد تنظیم می‌شود؛ Minimal وجود ندارد و Proactive Audio همیشه روشن است. بنابراین «مکالمه طبیعی» برای کاربر، مدیریت پیچیده‌تری در برنامه می‌خواهد و بستن ارتباط پس از اولین نشان پایان می‌تواند نتیجه ابزار را از دست بدهد.

صدا، تصویر و ۹۷ زبان؛ با یک اختلاف مهم در اسناد

گوگل در اطلاعیه معرفی می‌گوید Gemini 3.8 Live می‌تواند ۹۷ زبان را به‌صورت خودکار تشخیص دهد و در میانه گفتگو میان آن‌ها جابه‌جا شود. بااین‌حال، صفحه عمومی Live API در همان تاریخ، مکالمه و ترجمه زنده را برای ۷۰ زبان یا بیشتر توصیف می‌کند. ممکن است این دو عدد دامنه‌های متفاوتی داشته باشند یا مستندات عمومی هنوز همگام نشده باشد؛ تا انتشار فهرست دقیق ۹۷ زبان نباید پشتیبانی کامل فارسی را قطعی دانست.

مستندات API ورودی تصویر JPEG را تا یک فریم در ثانیه ذکر می‌کند؛ برای نشان‌دادن دستگاه یا محیط کافی است، اما با تحلیل ویدئوی روان تفاوت دارد. نمایش‌های گوگل از راهنمای شروع کارمند تا تبدیل طرح دستی به React، نمونه‌های کنترل‌شده سازنده‌اند و جای آزمون مستقل در شبکه ضعیف یا محیط شلوغ را نمی‌گیرند.

گوشی در دست کاربر هنگام تماس تصویری با دو نفر روی نمایشگر
نمونه توضیحی از ارتباط تصویری موبایل؛ این عکس رابط Gemini یا توانایی ورودی تصویری آن را نشان نمی‌دهد. عکس: Mikhail Nilov / Pexels؛ منبع ۲۷ آوریل ۲۰۲۱، دسترسی ۱۶ سپتامبر ۲۰۲۶.

اعداد بنچمارک امیدوارکننده‌اند، اما هنوز آزمایش گوگل‌اند

گوگل برای Extended Thinking امتیاز ۸۲٫۶ در شاخص کیفیت گفتاربه‌گفتار Artificial Analysis، ۶۸٫۶ درصد در τ-Voice، ۳۵٫۱ درصد در آزمون بانکی Sierra و ۹۷٫۷ درصد در Big Bench Audio را گزارش کرده است. نسخه پایه نیز رتبه دوم Speech Agent Arena را گرفته؛ همه این اعداد از اطلاعیه خود گوگل هستند.

9to5Google عرضه در Gemini Live، Gmail و Keep را تأیید کرده، اما آزمون مستقل کیفیت نیست. رفتار مدل با لهجه فارسی، صدای محیط، اینترنت ناپایدار و قطع‌کردن مکرر هنوز روشن نیست؛ رتبه بنچمارک معادل تجربه عالی برای هر زبان و دستگاه نیست.

قیمت API و هزینه پنهان یک گفت‌وگوی زنده

در صفحه رسمی قیمت Gemini API، هر دو مدل 3.8 Live در یک ردیف آمده‌اند. در سطح پولی، ورودی صوتی ۳ دلار به‌ازای یک میلیون توکن یا حدود ۰٫۰۰۵ دلار برای هر دقیقه و خروجی صوتی ۱۲ دلار یا حدود ۰٫۰۱۸ دلار برای هر دقیقه قیمت دارد. ورودی متنی ۰٫۷۵ دلار و خروجی متنی ۴٫۵۰ دلار به‌ازای یک میلیون توکن است؛ تصویر و ویدئو نیز جداگانه محاسبه می‌شوند.

یک دقیقه صدای ورودی و یک دقیقه خروجی حدود ۲٫۳ سنت هزینه مدل دارد؛ گفت‌وگوی واقعی ممکن است چند رفت‌وبرگشت، تصویر، جست‌وجو و ابزار داشته باشد. سطح رایگان فهرست شده، ولی سقف آن ثابت نیست و هزینه زیرساخت پخش زنده و ابزارهای بیرونی جداست.

Live API روی WebSocket حالت‌دار کار می‌کند: صدای ورودی PCM شانزده‌بیتی ۱۶ کیلوهرتز و خروجی ۲۴ کیلوهرتز است. گوگل برای اتصال مستقیم برنامه، توکن موقت را به‌جای کلید API دائمی توصیه می‌کند. Extended Thinking نیز حافظه نهان، اجرای کد، خروجی ساختاریافته و URL Context ندارد.

دو توسعه‌دهنده با هدفون در حال بررسی یک سامانه روی نمایشگر
عکس توضیحی از همکاری دو توسعه‌دهنده؛ این تصویر تیم گوگل یا پیاده‌سازی Gemini را نشان نمی‌دهد. عکس: Ron Lach / Pexels؛ منبع ۲۸ مه ۲۰۲۱، دسترسی ۱۶ سپتامبر ۲۰۲۶.

چه کسانی امروز به آن دسترسی دارند؟

نسخه پایه در Gemini API، Google AI Studio و Search Live در حال عرضه است. Extended Thinking نیز به API، AI Studio و Gemini Live آمده است. در Workspace، Docs Live برای مشترکان Google AI Pro و Ultra و Gmail Live و Keep Live برای مشترکان Google AI عرضه می‌شوند. نسخه سازمانی هنوز پیش‌نمایش خصوصی است.

این فهرست تضمین نمی‌کند همه حساب‌ها هم‌زمان گزینه تازه را ببینند. گوگل جدول کشوربه‌کشور روشنی برای این عرضه در اطلاعیه ارائه نکرده و درباره ایران وعده مشخصی نداده است. نوع اشتراک، زبان حساب، منطقه و انتشار مرحله‌ای می‌تواند نتیجه را تغییر دهد. همان‌طور که در بررسی Pixel Drop سپتامبر دیدیم، حضور یک قابلیت در خبر جهانی همیشه به معنی فعال‌بودن آن برای هر کاربر نیست.

صدای تولیدشده در محصولات هوش مصنوعی گوگل با SynthID علامت‌گذاری می‌شود؛ این درباره خروجی است و پاسخ کاملی برای نگهداری صدای ورودی نیست. صفحه قیمت می‌گوید محتوای سطح رایگان ممکن است برای بهبود محصولات استفاده شود و محتوای پولی نه. برای داده حساس باید شرایط همان حساب بررسی شود و خرید یا تغییر حساب بدون تأیید کاربر انجام نشود.

جمع‌بندی: پیشرفت واقعی، نه دستیار بی‌خطا

مهم‌ترین تغییر Gemini 3.8 Live فقط صدای طبیعی‌تر نیست؛ توانایی ادامه مکالمه هنگام استدلال و اجرای ابزار می‌تواند دستیار صوتی را از پاسخ‌گوی نوبتی به رابطی پیوسته‌تر تبدیل کند. نسخه پایه برای سرعت و هزینه مناسب‌تر است و Extended Thinking برای کار چندمرحله‌ای، البته با پیچیدگی فنی و احتمال تأخیر بیشتر.

برای کاربر، بهترین معیار فعلاً تجربه واقعی روی حساب و زبان خودش است: زمان پاسخ، امکان قطع‌کردن، دقت در نام‌ها و حفظ زمینه را آزمایش کند و کار حساس را بدون بازبینی نسپارد. برای توسعه‌دهنده، نسخه آزمایشی کوچک با لاگ دقیق، سقف هزینه و تأیید انسانی از اتصال مستقیم یک عامل صوتی به عملیات واقعی امن‌تر است.

شفافیت تحریریه: این گزارش بر پایه اسناد رسمی و یک گزارش مستقل تهیه شده و آزمون عملی Gemini 3.8 Live توسط چارسو نیست. تصاویر از Pexels با مجوز استفاده و ویرایش در وب و مجله انتخاب شده‌اند؛ همگی توضیحی‌اند و رابط Gemini، تأیید افراد حاضر در عکس یا تجربه کار با مدل را نشان نمی‌دهند. تصویر جلد از Michael Burrows / Pexels است.

منابع