Progamersarena.org – Google kembali memperluas kemampuan kecerdasan buatannya dengan meluncurkan Gemini 3.8 Live dan Gemini 3.8 Live Extended Thinking. Dua model AI terbaru ini dirancang untuk menghadirkan pengalaman percakapan suara yang lebih natural, cepat, dan interaktif, termasuk kemampuan memproses tugas di latar belakang ketika percakapan dengan pengguna masih berlangsung.
Google memperkenalkan kedua model tersebut pada 15 September 2026 sebagai bagian dari pengembangan teknologi audio Gemini. Menurut Google, Gemini 3.8 Live dan Gemini 3.8 Live Extended Thinking merupakan model percakapan langsung paling canggih yang mereka kembangkan hingga saat ini.
Perubahan penting yang dibawa bukan sekadar kemampuan AI untuk memahami suara dan memberikan jawaban secara verbal. Gemini kini dirancang agar dapat berbicara dengan pengguna sambil menjalankan proses lain di belakang layar. Dengan pendekatan tersebut, percakapan tidak harus berhenti hanya karena AI sedang mencari informasi, memanggil sebuah alat, atau menyelesaikan pekerjaan yang membutuhkan beberapa tahap.
Baca Juga: Sudah Update iOS 27? Ini 5 Fitur yang Wajib Kamu Coba
Apa Itu Gemini 3.8 Live?
Gemini 3.8 Live merupakan model AI berbasis audio yang dirancang untuk interaksi suara secara real-time. Model ini ditujukan untuk skenario yang membutuhkan respons cepat, percakapan dua arah yang lancar, serta kemampuan memahami konteks dari berbagai jenis input.
Google menyebut Gemini 3.8 Live dibangun dengan fokus pada skala dan efisiensi biaya, sekaligus mempertahankan kemampuan percakapan serta pemahaman visual. Model ini dapat menerima input berupa audio, gambar, video, dan teks, kemudian menghasilkan respons dalam bentuk audio maupun teks. Dokumentasi Google DeepMind menyebut model tersebut memiliki konteks input hingga 128K token dan output hingga 64K token.
Dengan kemampuan multimodal tersebut, pengguna tidak harus selalu menjelaskan sesuatu menggunakan kata-kata. Misalnya, pengguna dapat berbicara dengan Gemini sambil menunjukkan sebuah gambar atau video. AI kemudian dapat menggunakan informasi visual tersebut sebagai bagian dari konteks percakapan.
Pendekatan ini membuat interaksi dengan AI menjadi lebih mirip percakapan dengan asisten digital yang memahami situasi secara langsung, bukan sekadar sistem tanya jawab berbasis teks.
Gemini 3.8 Live Bisa Bicara Sambil Bekerja
Salah satu perubahan paling menarik dari Gemini 3.8 Live adalah kemampuan menjalankan pekerjaan tanpa harus memutus alur percakapan.
Dalam penggunaan AI konvensional, pengguna biasanya harus menunggu ketika sistem sedang menjalankan proses tertentu. Jika AI perlu mencari informasi atau menggunakan tool eksternal, percakapan dapat terhenti sampai proses tersebut selesai.
Gemini 3.8 Live dirancang untuk mengurangi jeda semacam itu. Google menjelaskan bahwa model baru ini mampu melakukan tugas sambil mempertahankan dialog dengan pengguna.
Artinya, pengalaman berbicara dengan AI dapat menjadi lebih dinamis. Pengguna tidak selalu harus menunggu dalam kondisi hening ketika sebuah permintaan sedang diproses.
Konsep tersebut menjadi semakin penting untuk pengembangan voice agent atau agen AI berbasis suara. Dalam layanan seperti customer service, asisten pribadi, layanan perjalanan, hingga dukungan teknis, jeda panjang ketika AI menjalankan sebuah tool dapat membuat pengalaman terasa kurang natural.
Dengan Gemini 3.8 Live, Google mencoba mengurangi masalah tersebut melalui pemrosesan yang dirancang untuk percakapan real-time.
Gemini 3.8 Live Mendukung Input Audio, Teks, Gambar, dan Video
Kemampuan multimodal menjadi bagian penting dari Gemini 3.8 Live. Model ini tidak hanya menerima suara, tetapi juga dapat memproses beberapa jenis input lain.
Menurut model card Google DeepMind, Gemini 3.8 Live dan Gemini 3.8 Live Extended Thinking mendukung input berupa:
- Audio
- Gambar
- Video
- Teks
Sementara output model dapat diberikan dalam bentuk audio dan teks.
Kemampuan tersebut memungkinkan berbagai skenario penggunaan. Sebagai contoh, seseorang dapat bertanya menggunakan suara sambil memperlihatkan sebuah gambar. AI kemudian dapat menggabungkan informasi yang didengar dan dilihat sebelum memberikan respons.
Bagi pengguna, proses ini dapat terasa lebih sederhana karena tidak perlu mengubah mode interaksi secara manual setiap kali ingin memberikan konteks tambahan.
Bisa Beralih Bahasa di Tengah Percakapan
Fitur lain yang menjadi perhatian adalah kemampuan percakapan multibahasa. Gemini 3.8 Live mendukung 97 bahasa dan dirancang agar pengguna dapat berpindah bahasa ketika percakapan sedang berlangsung.
Kemampuan ini berguna untuk percakapan yang melibatkan lebih dari satu bahasa. Pengguna tidak perlu menghentikan percakapan hanya untuk mengubah pengaturan bahasa secara manual.
Google juga menempatkan dukungan multibahasa sebagai salah satu bagian dari upaya membuat interaksi suara dengan Gemini lebih fleksibel dan alami. Search Live yang menggunakan Gemini 3.8 Live juga disebut mendapatkan dukungan percakapan multibahasa, termasuk kemampuan berpindah bahasa di tengah percakapan.
Bagi pengguna global, kemampuan tersebut dapat menjadi faktor penting karena percakapan sehari-hari sering kali tidak selalu berlangsung dalam satu bahasa.
Apa Itu Gemini 3.8 Live Extended Thinking?
Selain Gemini 3.8 Live, Google menghadirkan Gemini 3.8 Live Extended Thinking.
Jika Gemini 3.8 Live lebih diarahkan pada percakapan cepat dan kebutuhan real-time, versi Extended Thinking dirancang untuk pekerjaan yang membutuhkan penalaran lebih kompleks dan proses multi-langkah.
Dokumentasi Google menyebut Gemini 3.8 Live Extended Thinking sebagai model audio-to-audio dengan kemampuan penalaran tinggi yang dapat melakukan reasoning di latar belakang selama interaksi suara berlangsung. Model tersebut juga dapat menjalankan tool secara asynchronous ketika menyelesaikan pekerjaan yang kompleks.
Perbedaan ini penting karena tugas yang membutuhkan beberapa tahapan biasanya memiliki waktu pemrosesan lebih panjang. Dalam sistem voice AI tradisional, waktu tunggu tersebut berpotensi menciptakan keheningan yang terasa janggal.
Gemini 3.8 Live Extended Thinking mencoba mengatasi persoalan tersebut dengan tetap menjaga percakapan berjalan.
AI Bisa Memberikan Respons Sambil Melakukan Penalaran
Bayangkan pengguna meminta AI melakukan pekerjaan yang membutuhkan beberapa langkah.
Alih-alih langsung diam sampai seluruh proses selesai, Gemini 3.8 Live Extended Thinking dapat memberikan respons singkat yang menunjukkan bahwa permintaan sedang diproses. Misalnya, AI dapat memberikan tanda verbal bahwa ia sedang memeriksa informasi sebelum memberikan jawaban akhir.
Google menyebut pendekatan tersebut sebagai bagian dari pengalaman yang memungkinkan model reasoning dan berbicara secara bersamaan.
Dalam dokumentasi Live API, Google menjelaskan bahwa model dapat mengirim conversational filler ketika melakukan reasoning atau menunggu hasil tool. Status interaksi juga dapat menunjukkan bahwa proses masih berlangsung sebelum akhirnya kembali ke kondisi idle.
Bagi pengguna, perbedaannya cukup signifikan. AI tidak lagi terasa seperti sistem yang tiba-tiba berhenti merespons ketika sedang mengerjakan sesuatu.
Extended Thinking Cocok untuk Tugas yang Lebih Kompleks
Gemini 3.8 Live Extended Thinking ditujukan untuk berbagai pekerjaan yang membutuhkan beberapa tahapan proses.
Contohnya meliputi:
- Mencari dan menggabungkan informasi dari beberapa sumber.
- Menyelesaikan persoalan yang membutuhkan penalaran bertahap.
- Menjalankan beberapa tool secara berurutan.
- Membantu proses troubleshooting.
- Mengelola pekerjaan yang membutuhkan pencarian informasi.
- Membantu membuat atau mengedit dokumen.
- Menjalankan tugas yang membutuhkan perencanaan lebih kompleks.
Google memberikan contoh penggunaan Live API untuk skenario seperti dukungan teknis, pencarian data perjalanan, pembelajaran STEM dan coding, serta pekerjaan yang membutuhkan beberapa panggilan tool.
Dengan demikian, Extended Thinking tidak hanya ditujukan untuk membuat AI terdengar lebih pintar. Fokus utamanya adalah memungkinkan proses reasoning dan eksekusi tugas berjalan tanpa merusak alur percakapan suara.
Gemini 3.8 Live Extended Thinking di Gemini Live
Google mulai menggunakan Gemini 3.8 Live Extended Thinking dalam pengalaman Gemini Live.
Gemini Live sendiri merupakan pengalaman percakapan suara yang memungkinkan pengguna berbicara dengan Gemini secara langsung. Dengan model baru ini, Google ingin membuat interaksi tersebut terasa lebih responsif ketika pengguna meminta AI melakukan pekerjaan yang lebih kompleks.
Selain Gemini Live, kemampuan Extended Thinking juga diarahkan untuk sejumlah pengalaman yang terhubung dengan layanan Google.
Menurut laporan 9to5Google, penerapannya mencakup fitur seperti Gmail Live, Docs Live, dan Keep Live, yang memungkinkan pengguna berinteraksi dengan fungsi-fungsi tersebut melalui percakapan.
Bisa Membantu Gmail, Google Docs, dan Google Keep
Integrasi dengan ekosistem Google menjadi salah satu aspek menarik dari peluncuran Gemini 3.8 Live Extended Thinking.
Dalam konteks Gmail, model dapat digunakan untuk membantu pencarian informasi melalui percakapan. Sementara itu, pada Docs, kemampuan AI diarahkan untuk membantu membuat atau mengedit dokumen.
Google Keep juga menjadi bagian dari skenario penggunaan yang disebutkan dalam laporan mengenai peluncuran model ini. Pengguna dapat memanfaatkan interaksi suara untuk membantu membuat catatan.
Kemampuan tersebut memperlihatkan arah pengembangan Gemini yang semakin berfokus pada AI sebagai agen, bukan hanya chatbot yang menjawab pertanyaan.
Perbedaan utamanya adalah AI tidak hanya memberikan informasi, tetapi juga dapat membantu menjalankan pekerjaan berdasarkan instruksi pengguna.
Gemini 3.8 Live Hadir di Search Live
Gemini 3.8 Live juga digunakan untuk meningkatkan pengalaman Search Live pada Google Search.
Search Live memungkinkan pengguna melakukan pencarian menggunakan percakapan suara secara real-time. Dengan Gemini 3.8 Live sebagai model yang mendukung pengalaman tersebut, Google ingin membuat interaksi pencarian terasa lebih natural dan tidak terlalu kaku.
Pengguna dapat mengajukan pertanyaan, melanjutkan pertanyaan berdasarkan jawaban sebelumnya, serta berpindah bahasa dalam percakapan.
Model juga dirancang untuk menggunakan konteks visual dalam pengalaman yang mendukung input tersebut. Hal ini membuat pencarian berbasis suara tidak sekadar menjadi versi verbal dari kolom pencarian tradisional.
Gemini 3.8 Live untuk Developer
Tidak hanya tersedia dalam produk Google, kedua model ini juga ditawarkan kepada developer melalui Gemini API dan Google AI Studio.
Google secara khusus memosisikan Gemini 3.8 Live dan Gemini 3.8 Live Extended Thinking sebagai fondasi untuk membangun aplikasi voice agent yang dapat digunakan dalam lingkungan produksi.
Bagi developer, hal ini membuka kemungkinan untuk membuat aplikasi dengan kemampuan seperti:
- Asisten suara real-time.
- Customer service berbasis AI.
- Agen perjalanan.
- Asisten produktivitas.
- Tutor interaktif.
- Agen dukungan teknis.
- Sistem voice commerce.
- Aplikasi pencarian berbasis percakapan.
- Asisten untuk pekerjaan administratif.
Dokumentasi Gemini API juga menunjukkan bahwa Extended Thinking menggunakan function calling secara asynchronous. Developer yang mengintegrasikannya perlu menangani status interaksi karena model dapat terus melakukan pemrosesan setelah satu bagian percakapan selesai.
Baca Juga: Spesifikasi dan Harga ASUS TUF Gaming 16 (FX610J) di Indonesia
Perbedaan Gemini 3.8 Live dan Extended Thinking
Secara sederhana, kedua model tersebut memiliki fokus yang berbeda.
Gemini 3.8 Live lebih sesuai untuk interaksi yang mengutamakan kecepatan, percakapan real-time, dan tugas yang membutuhkan respons langsung.
Sementara itu, Gemini 3.8 Live Extended Thinking dirancang untuk permintaan yang membutuhkan reasoning lebih dalam, perencanaan multi-langkah, serta penggunaan tool secara asynchronous.
Perbedaan ini membuat developer dapat memilih model berdasarkan kebutuhan aplikasinya. Untuk percakapan sederhana yang membutuhkan latensi rendah, Gemini 3.8 Live dapat menjadi pilihan yang relevan. Untuk workflow yang lebih kompleks, Extended Thinking menyediakan kemampuan penalaran tambahan.
Google sendiri menjelaskan bahwa Gemini 3.8 Live berfokus pada low-latency voice agent, direct commands, dan penggunaan tool yang cepat, sedangkan Extended Thinking diarahkan pada problem solving multi-langkah dan workflow dengan beberapa tool.
Hasil Pengujian Gemini 3.8 Live Extended Thinking
Google juga mempublikasikan sejumlah hasil evaluasi untuk Gemini 3.8 Live Extended Thinking.
Dalam pengumumannya, Google menyebut model tersebut memperoleh skor 82,6 pada Speech to Speech Quality Index dari Artificial Analysis. Google juga menyatakan model ini mencatat 97,7 persen pada Big Bench Audio.
Angka tersebut memberikan gambaran mengenai performa model berdasarkan pengujian yang digunakan. Namun, hasil benchmark sebaiknya tetap dipahami sesuai metodologi masing-masing pengujian dan tidak secara otomatis menggambarkan seluruh pengalaman pengguna dalam berbagai kondisi.
Bagi developer, benchmark dapat menjadi salah satu bahan pertimbangan ketika mengevaluasi model. Faktor lain seperti latensi, biaya, dukungan bahasa, kemampuan tool calling, kualitas audio, dan kebutuhan aplikasi juga tetap penting.
Mengapa Kemampuan AI Berbicara Sambil Bekerja Penting?
Salah satu tantangan terbesar voice AI adalah jeda ketika sistem sedang melakukan pekerjaan.
Dalam percakapan manusia, ketika seseorang sedang mencari sesuatu, biasanya ia tetap dapat memberikan tanda bahwa proses tersebut sedang dilakukan. Misalnya, seseorang dapat mengatakan bahwa ia sedang memeriksa informasi.
Voice AI tradisional sering kali tidak dapat melakukan hal tersebut dengan baik. Sistem harus menunggu tool selesai sebelum memberikan respons berikutnya.
Gemini 3.8 Live Extended Thinking membawa pendekatan berbeda dengan memungkinkan model tetap memberikan respons suara ketika reasoning dan pemanggilan tool berlangsung di belakang layar.
Konsep ini berpotensi membuat AI terasa lebih seperti partner percakapan daripada mesin penjawab otomatis.
Dampaknya bagi Masa Depan Voice AI
Peluncuran Gemini 3.8 Live menunjukkan bahwa persaingan AI tidak hanya berfokus pada kemampuan menghasilkan teks atau gambar.
Percakapan suara kini menjadi bagian penting dari pengembangan AI generatif.
Kemampuan untuk mendengar, memahami visual, melakukan reasoning, menggunakan tool, dan memberikan respons secara verbal dalam waktu hampir bersamaan dapat membuka lebih banyak skenario penggunaan.
Dalam jangka panjang, teknologi semacam ini dapat digunakan pada layanan pelanggan, pendidikan, produktivitas, otomotif, perangkat pintar, aplikasi perusahaan, hingga berbagai jenis agen digital.
Khusus bagi perusahaan, voice agent yang mampu melakukan pekerjaan sambil mempertahankan percakapan dapat membantu menciptakan pengalaman interaksi yang lebih interaktif.
Gemini 3.8 Live Sudah Dirilis
Google mengumumkan Gemini 3.8 Live dan Gemini 3.8 Live Extended Thinking pada 15 September 2026. Keduanya tersedia sebagai bagian dari pengembangan teknologi audio Gemini, termasuk melalui Gemini API dan Google AI Studio untuk kebutuhan developer.
Gemini 3.8 Live diarahkan pada percakapan suara yang cepat, multimodal, dan responsif. Sementara Gemini 3.8 Live Extended Thinking membawa kemampuan reasoning multi-langkah serta pemrosesan tool secara asynchronous agar AI dapat tetap berinteraksi ketika sebuah tugas sedang berlangsung.
Dengan pendekatan tersebut, Google mencoba mengubah cara pengguna berinteraksi dengan AI. Alih-alih menunggu AI menyelesaikan pekerjaan sebelum berbicara kembali, pengguna dapat mempertahankan percakapan sambil sistem bekerja di belakang layar.
Bagi pengguna umum, perubahan ini dapat membuat asisten AI terasa lebih natural. Bagi developer, kehadiran kedua model tersebut juga memberikan fondasi baru untuk membangun aplikasi voice agent yang lebih interaktif dan mampu menangani pekerjaan kompleks.
Pada akhirnya, Gemini 3.8 Live bukan hanya tentang membuat AI dapat berbicara. Fokus yang lebih besar adalah menciptakan percakapan AI yang tetap berjalan ketika AI sedang bekerja. Inilah salah satu arah penting perkembangan teknologi voice AI pada 2026.