Google memperbarui lini model suara Gemini dengan Gemini 3.8 Live dan Gemini 3.8 Live Extended Thinking. Keduanya dirancang bukan hanya untuk menjawab ucapan secara real time, tetapi juga untuk mempertahankan percakapan ketika model memproses gambar atau video, memanggil alat, dan mengerjakan langkah lanjutan di latar.

Pengumuman utama terbit pada 15 September 2026, lalu diperbarui Google pada 17 September. Versi Live ditujukan untuk percakapan yang cepat dan efisien, sedangkan Live Extended Thinking diarahkan ke tugas yang membutuhkan penalaran lebih panjang. Keduanya tersedia melalui Gemini API dan Google AI Studio. Google juga menyebut peluncuran untuk Gemini App, Search Live, dan sejumlah layanan Workspace.

## Percakapan tidak harus berhenti saat alat bekerja

Perubahan yang paling terasa ada pada cara model menangani tool calling. Dalam pola chatbot lama, pengguna biasanya menunggu satu jawaban selesai sebelum model melakukan langkah berikutnya. Google mengatakan Gemini 3.8 Live dapat menjalankan pemanggilan fungsi secara asinkron. Model tetap berbicara atau memberi respons singkat ketika API, pencarian data, atau proses lain berjalan di belakang layar.

Contohnya bukan sekadar menjawab pertanyaan tentang jadwal. Agen suara dapat menerima permintaan, memeriksa ketersediaan, memanggil layanan eksternal, lalu melanjutkan dialog tanpa membuat pengguna berhadapan dengan layar pemuatan yang panjang. Untuk produk customer service, pola ini bisa membuat percakapan terasa lebih dekat ke operator manusia—meski kualitas akhirnya tetap bergantung pada sistem yang dipasang di belakang model.

Extended Thinking menambahkan lapisan penalaran untuk pekerjaan yang lebih rumit. Google mencontohkan alur seperti pemesanan dengan banyak langkah, penyusunan rencana, dan pembuatan komponen React dari sketsa yang dijelaskan lewat suara. Model dapat menyampaikan tanda bahwa ia sedang memeriksa sesuatu sambil tetap mengerjakan tugas, alih-alih diam sampai seluruh proses selesai.

## Model juga membawa konteks visual

Gemini 3.8 Live menerima audio, gambar, video, dan teks dengan jendela konteks hingga 128 ribu token menurut model card Google DeepMind. Artinya, percakapan suara dapat diperkaya dengan apa yang sedang dilihat pengguna: formulir yang perlu diisi, papan catur, layar aplikasi, atau situasi di sekitar kamera.

Kemampuan ini menggeser definisi “asisten suara”. Model tidak lagi hanya mendengar perintah seperti “carikan restoran”, tetapi berpotensi memahami objek dan keadaan yang ditunjukkan pengguna. Dalam demo Google, konteks visual dipakai untuk bantuan onboarding dan pemecahan masalah secara langsung. Ini masih merupakan klaim dan demonstrasi dari pembuat model, bukan jaminan bahwa setiap implementasi akan akurat di dunia nyata.

Google juga menyebut dukungan perpindahan antar-97 bahasa dalam satu percakapan, dengan sinkronisasi suara dan konteks visual yang tetap dijaga. Angka tersebut perlu dibaca sebagai cakupan dukungan produk, bukan bukti bahwa kualitas pemahaman akan sama untuk semua bahasa, aksen, dan kondisi audio.

## Google menjualnya sebagai fondasi agen suara

Rilis ini menempatkan Gemini 3.8 Live lebih dekat ke infrastruktur agen daripada fitur voice chat biasa. Google mencantumkan integrasi atau dukungan dari platform seperti LiveKit, Pipecat, Agora, Vercel, dan LangChain. Bagi pengembang, daya tariknya adalah mengurangi kebutuhan merangkai model speech-to-text, model teks, dan text-to-speech secara terpisah.

Google menyebut harga API sebesar 0,005 dolar AS per menit untuk audio masuk dan 0,018 dolar AS per menit untuk audio keluar. Biaya nyata tetap akan dipengaruhi durasi percakapan, pemrosesan multimodal, pemanggilan alat, penyimpanan, serta layanan lain yang mengelilingi model. Klaim performa seperti skor Artificial Analysis, tau-Voice, dan benchmark lain juga berasal dari pengukuran yang dipilih atau dikutip Google; angka itu berguna sebagai konteks, tetapi bukan pengganti pengujian independen pada produk yang akan dibangun.

Ada pula lapisan transparansi. Google mengatakan output audio dari produk AI-nya diberi watermark SynthID. Model card Gemini 3.8 Audio tetap mencantumkan keterbatasan umum model fondasi, termasuk halusinasi, potensi lambat atau timeout, serta kebutuhan mitigasi jailbreak. Dengan kata lain, suara yang terdengar lancar tidak menghapus risiko jawaban keliru atau tindakan alat yang salah.

## Yang berubah bagi pengembang

Gemini 3.8 Live memberi pengembang bahan dasar untuk membuat antarmuka suara yang lebih aktif: mendengar, melihat, berbicara, dan mengerjakan pekerjaan secara paralel. Namun tantangan produknya bergeser dari sekadar membuat model merespons menjadi memastikan izin, pembatalan, konfirmasi, logging, dan fallback bekerja dengan benar. Agen yang dapat memanggil API di tengah percakapan membutuhkan batas yang jelas untuk tindakan berisiko, terutama ketika pengguna berbicara dalam bahasa campuran atau memberi instruksi yang ambigu.

Peluncuran ini menunjukkan arah yang sedang dikejar Google: suara bukan lagi lapisan input untuk chatbot, tetapi antarmuka utama bagi agen yang bekerja sambil terus berkomunikasi. Apakah pengalaman itu benar-benar lebih nyaman akan ditentukan oleh latensi, akurasi, biaya, dan seberapa mudah pengguna menghentikan tindakan yang tidak mereka maksudkan.

## Sumber

- Primary: https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/ - Primary: https://blog.google/innovation-and-ai/technology/developers-tools/build-real-time-voice-applications-gemini-audio/ - Research / safety context: https://deepmind.google/models/model-cards/gemini-3-8-audio/ - Product context: https://deepmind.google/models/gemini-audio/