Gemini 3.8 Live آمد؛ مکالمه صوتی گوگل همزمان فکر میکند و حرف میزند
گوگل دو مدل صوتی Gemini 3.8 Live را عرضه کرده است؛ یکی سریع و اقتصادی، دیگری برای استدلال چندمرحلهای. قابلیتها، قیمت و محدودیتهای واقعی را بررسی میکنیم.

دستیار صوتی وقتی واقعاً مفید میشود که فقط منتظر تمامشدن جمله نماند: باید حرف کاربر را بفهمد، در میانه مکالمه ابزار لازم را اجرا کند و بدون سکوت طولانی نتیجه را برگرداند. گوگل در ۱۵ سپتامبر ۲۰۲۶ دو مدل تازه برای همین مسئله معرفی کرد: Gemini 3.8 Live و Gemini 3.8 Live Extended Thinking.
نسخه پایه برای مکالمه روان و هزینه کمتر ساخته شده؛ Extended Thinking هنگام صحبت، استدلال چندمرحلهای و فراخوانی ابزارها را در پسزمینه ادامه میدهد. عرضه در Gemini API و AI Studio آغاز شده و به Gemini Live، Search Live و Workspace میرسد، اما دسترسی به کشور، زبان و نوع اشتراک بستگی دارد.
دو مدل برای دو نوع مکالمه
Gemini 3.8 Live مدل سریعتر و اقتصادیتر خانواده است. طبق توضیح گوگل، ورودی صوتی و تصویری را نزدیک به زمان واقعی پردازش میکند، میان زبانهای پشتیبانیشده جابهجا میشود و هنگام ادامه گفتگو ابزار یا API را صدا میزند. دستیار خرید، راهنمای عیبیابی و آموزش تعاملی کاربردهای روشن آن هستند.
Gemini 3.8 Live Extended Thinking برای کارهای پیچیدهتر است. مدل میتواند با جملهای مانند «اجازه بده بررسی کنم» پاسخ اولیه بدهد و همزمان استدلال و کار چندمرحلهای را پیش ببرد؛ کاربر برای هر فراخوانی ابزار مجبور به تحمل سکوت کامل نیست.
این معماری البته تضمین نمیکند هر پاسخ سریع یا درست باشد. کارت مدل رسمی هر دو نسخه را مبتنی بر Gemini 3 Pro معرفی میکند و صریحاً از احتمال توهم، کندی و پایانزمان نام میبرد. تاریخ قطع دانش مدل ژانویه ۲۰۲۵ است؛ بنابراین برای اطلاعات جدید باید به جستوجو یا منبع بیرونی متکی باشد.
«همزمان فکرکردن و حرفزدن» در عمل چه معنایی دارد؟
مستندات فنی گوگل هشدار میدهد که دریافت turnComplete: true دیگر لزوماً به معنی بیکارشدن مدل نیست. برنامه باید پیامهای بعدی، فریمهای صوتی یا درخواست ابزار را همچنان گوش کند و وضعیت واقعی را از interaction_status بخواند. در این مدل فقط فراخوانی تابع ناهمگام و غیرمسدودکننده پشتیبانی میشود؛ حالت همگام خطای سخت میدهد.
سطح استدلال روی کم، متوسط یا زیاد تنظیم میشود؛ Minimal وجود ندارد و Proactive Audio همیشه روشن است. بنابراین «مکالمه طبیعی» برای کاربر، مدیریت پیچیدهتری در برنامه میخواهد و بستن ارتباط پس از اولین نشان پایان میتواند نتیجه ابزار را از دست بدهد.
صدا، تصویر و ۹۷ زبان؛ با یک اختلاف مهم در اسناد
گوگل در اطلاعیه معرفی میگوید Gemini 3.8 Live میتواند ۹۷ زبان را بهصورت خودکار تشخیص دهد و در میانه گفتگو میان آنها جابهجا شود. بااینحال، صفحه عمومی Live API در همان تاریخ، مکالمه و ترجمه زنده را برای ۷۰ زبان یا بیشتر توصیف میکند. ممکن است این دو عدد دامنههای متفاوتی داشته باشند یا مستندات عمومی هنوز همگام نشده باشد؛ تا انتشار فهرست دقیق ۹۷ زبان نباید پشتیبانی کامل فارسی را قطعی دانست.
مستندات API ورودی تصویر JPEG را تا یک فریم در ثانیه ذکر میکند؛ برای نشاندادن دستگاه یا محیط کافی است، اما با تحلیل ویدئوی روان تفاوت دارد. نمایشهای گوگل از راهنمای شروع کارمند تا تبدیل طرح دستی به React، نمونههای کنترلشده سازندهاند و جای آزمون مستقل در شبکه ضعیف یا محیط شلوغ را نمیگیرند.
اعداد بنچمارک امیدوارکنندهاند، اما هنوز آزمایش گوگلاند
گوگل برای Extended Thinking امتیاز ۸۲٫۶ در شاخص کیفیت گفتاربهگفتار Artificial Analysis، ۶۸٫۶ درصد در τ-Voice، ۳۵٫۱ درصد در آزمون بانکی Sierra و ۹۷٫۷ درصد در Big Bench Audio را گزارش کرده است. نسخه پایه نیز رتبه دوم Speech Agent Arena را گرفته؛ همه این اعداد از اطلاعیه خود گوگل هستند.
9to5Google عرضه در Gemini Live، Gmail و Keep را تأیید کرده، اما آزمون مستقل کیفیت نیست. رفتار مدل با لهجه فارسی، صدای محیط، اینترنت ناپایدار و قطعکردن مکرر هنوز روشن نیست؛ رتبه بنچمارک معادل تجربه عالی برای هر زبان و دستگاه نیست.
قیمت API و هزینه پنهان یک گفتوگوی زنده
در صفحه رسمی قیمت Gemini API، هر دو مدل 3.8 Live در یک ردیف آمدهاند. در سطح پولی، ورودی صوتی ۳ دلار بهازای یک میلیون توکن یا حدود ۰٫۰۰۵ دلار برای هر دقیقه و خروجی صوتی ۱۲ دلار یا حدود ۰٫۰۱۸ دلار برای هر دقیقه قیمت دارد. ورودی متنی ۰٫۷۵ دلار و خروجی متنی ۴٫۵۰ دلار بهازای یک میلیون توکن است؛ تصویر و ویدئو نیز جداگانه محاسبه میشوند.
یک دقیقه صدای ورودی و یک دقیقه خروجی حدود ۲٫۳ سنت هزینه مدل دارد؛ گفتوگوی واقعی ممکن است چند رفتوبرگشت، تصویر، جستوجو و ابزار داشته باشد. سطح رایگان فهرست شده، ولی سقف آن ثابت نیست و هزینه زیرساخت پخش زنده و ابزارهای بیرونی جداست.
Live API روی WebSocket حالتدار کار میکند: صدای ورودی PCM شانزدهبیتی ۱۶ کیلوهرتز و خروجی ۲۴ کیلوهرتز است. گوگل برای اتصال مستقیم برنامه، توکن موقت را بهجای کلید API دائمی توصیه میکند. Extended Thinking نیز حافظه نهان، اجرای کد، خروجی ساختاریافته و URL Context ندارد.
چه کسانی امروز به آن دسترسی دارند؟
نسخه پایه در Gemini API، Google AI Studio و Search Live در حال عرضه است. Extended Thinking نیز به API، AI Studio و Gemini Live آمده است. در Workspace، Docs Live برای مشترکان Google AI Pro و Ultra و Gmail Live و Keep Live برای مشترکان Google AI عرضه میشوند. نسخه سازمانی هنوز پیشنمایش خصوصی است.
این فهرست تضمین نمیکند همه حسابها همزمان گزینه تازه را ببینند. گوگل جدول کشوربهکشور روشنی برای این عرضه در اطلاعیه ارائه نکرده و درباره ایران وعده مشخصی نداده است. نوع اشتراک، زبان حساب، منطقه و انتشار مرحلهای میتواند نتیجه را تغییر دهد. همانطور که در بررسی Pixel Drop سپتامبر دیدیم، حضور یک قابلیت در خبر جهانی همیشه به معنی فعالبودن آن برای هر کاربر نیست.
صدای تولیدشده در محصولات هوش مصنوعی گوگل با SynthID علامتگذاری میشود؛ این درباره خروجی است و پاسخ کاملی برای نگهداری صدای ورودی نیست. صفحه قیمت میگوید محتوای سطح رایگان ممکن است برای بهبود محصولات استفاده شود و محتوای پولی نه. برای داده حساس باید شرایط همان حساب بررسی شود و خرید یا تغییر حساب بدون تأیید کاربر انجام نشود.
جمعبندی: پیشرفت واقعی، نه دستیار بیخطا
مهمترین تغییر Gemini 3.8 Live فقط صدای طبیعیتر نیست؛ توانایی ادامه مکالمه هنگام استدلال و اجرای ابزار میتواند دستیار صوتی را از پاسخگوی نوبتی به رابطی پیوستهتر تبدیل کند. نسخه پایه برای سرعت و هزینه مناسبتر است و Extended Thinking برای کار چندمرحلهای، البته با پیچیدگی فنی و احتمال تأخیر بیشتر.
برای کاربر، بهترین معیار فعلاً تجربه واقعی روی حساب و زبان خودش است: زمان پاسخ، امکان قطعکردن، دقت در نامها و حفظ زمینه را آزمایش کند و کار حساس را بدون بازبینی نسپارد. برای توسعهدهنده، نسخه آزمایشی کوچک با لاگ دقیق، سقف هزینه و تأیید انسانی از اتصال مستقیم یک عامل صوتی به عملیات واقعی امنتر است.
شفافیت تحریریه: این گزارش بر پایه اسناد رسمی و یک گزارش مستقل تهیه شده و آزمون عملی Gemini 3.8 Live توسط چارسو نیست. تصاویر از Pexels با مجوز استفاده و ویرایش در وب و مجله انتخاب شدهاند؛ همگی توضیحیاند و رابط Gemini، تأیید افراد حاضر در عکس یا تجربه کار با مدل را نشان نمیدهند. تصویر جلد از Michael Burrows / Pexels است.
منابع
- Google Blog: Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking — منتشرشده ۱۵ سپتامبر ۲۰۲۶؛ مشاهده ۱۶ سپتامبر ۲۰۲۶.
- Google AI for Developers: Gemini 3.8 Live Extended Thinking — مشخصات و پروتکل ناهمگام؛ بهروزرسانی ۱۵ سپتامبر و مشاهده ۱۶ سپتامبر ۲۰۲۶.
- Google AI for Developers: Live API overview — معماری، قالب صدا و ورودی تصویر؛ بهروزرسانی ۱۵ سپتامبر و مشاهده ۱۶ سپتامبر ۲۰۲۶.
- Google AI for Developers: Gemini API pricing — قیمت مدلهای زنده؛ مشاهده ۱۶ سپتامبر ۲۰۲۶.
- Google DeepMind: Gemini 3.8 Audio model card — منتشرشده ۱۵ سپتامبر و مشاهده ۱۶ سپتامبر ۲۰۲۶.
- 9to5Google: Gemini 3.8 Live Extended Thinking powers Gemini Live, Gmail & Keep — منتشرشده ۱۵ سپتامبر و مشاهده ۱۶ سپتامبر ۲۰۲۶.



