Gemini 3.8 Live dan Extended Thinking Rilis, Cek Fitur dan Keunggulannya

Google merilis fitur Gemini 3.8 Live dan Extended Thinking untuk mendukung agen suara cerdas dengan penalaran real time serta akurasi tinggi.

Janalokajournal.idGoogle kembali membuat terobosan besar dalam dunia kecerdasan buatan dengan memperkenalkan dua model baru yang mengusung kemampuan penalaran mendalam dan hampir real time. Kehadiran teknologi ini dirancang untuk mengoptimalkan agen suara cerdas agar percakapan interaktif terasa jauh lebih alami, responsif, serta intuitif.

Inovasi utama yang menjadi sorotan dunia teknologi adalah fitur Gemini 3.8 Live yang dibangun untuk efisiensi biaya dan skala besar, serta varian Gemini 3.8 Live Extended Thinking yang difokuskan pada pemecahan alur kerja rumit dengan analisis multi-langkah.

Bagi para pengembang peranti lunak dan skala perusahaan, kedua model ini menyediakan fondasi utama untuk membangun sistem agen suara yang stabil dan siap pakai di lingkungan produksi. Peningkatan ini membuat komunikasi berbasis suara di berbagai platform utama seperti aplikasi mandiri, Google Workspace, hingga penelusuran Search berjalan makin lancar. Pengguna kini dapat menyelesaikan berbagai tugas kompleks hanya menggunakan perintah suara tanpa hambatan interaksi.

Pembaruan teknologi ini membawa standar baru dalam kualifikasi pengujian pemrosesan bahasa dan audio global. Berdasarkan analisis independen, model terbaru ini berhasil membuktikan keunggulannya dalam menjamin efisiensi biaya sekaligus ketepatan respons saat menjalankan instruksi teknis.

Performa Unggul dari Pengujian

Gemini 3.8 Live dan Extended Thinking
Gemini 3.8 Live dan Extended Thinking

Model Gemini 3.8 Live Extended Thinking mencatatkan prestasi luar biasa dalam pengujian kelas industri untuk kategori pemrosesan agen berbasis suara.

  • Menguasai posisi peringkat pertama pada evaluasi Speech to Speech Quality Index dari Artificial Analysis dengan raihan skor 82,6%.
  • Memimpin kualifikasi penyelesaian tugas agen suara dengan raihan 68,6% pada uji τ-Voice serta 35.1% pada tolok ukur τ-Voice-banking dari Sierra.
  • Menunjukkan kemampuan penalaran audio yang sangat kuat dengan skor 97,7% pada tolok ukur Big Bench Audio.
  • Menawarkan penawaran harga yang sangat kompetitif dibandingkan model kecerdasan buatan terdepan lainnya di pasar global.
  • Varian standar Gemini 3.8 Live menempati posisi kedua dalam arena persaingan Speech Agent Arena berdasarkan tingkat preferensi pengguna.
  • Menyediakan solusi hemat biaya yang sangat efisien bagi pengembang yang membutuhkan pemrosesan agen suara berskala besar.
  • Mendorong pergeseran kurva Pareto Frontier pada pengujian ServiceNow EVA-Bench dengan menyeimbangkan tingkat akurasi dan kualitas percakapan pada alur kerja rumit.

Pemrosesan Konteks Visual

Teknologi pendukung pada fitur Gemini 3.8 Live tidak hanya terbatas pada pemrosesan suara, tetapi juga mencakup pemahaman visual secara langsung untuk memperkaya konteks percakapan.

Sistem secara otomatis mampu mendeteksi dan berpindah antar 97 bahasa yang didukung di tengah-tengah percakapan tanpa perlu pengondisian ulang. Selain itu, model ini dapat menjalankan pemanggilan API dan eksekusi instruksi peranti lunak di latar belakang sambil tetap melanjutkan alur pembicaraan secara alami. Hal ini membuat AI dapat mengonfirmasi permintaan pengguna secara langsung dan tetap diajak berdialog selagi proses latar belakang diselesaikan hingga tuntas.

Kemampuan analisis visual real time ini memungkinkan sistem membantu proses orientasi karyawan baru dengan menjawab pertanyaan langsung berdasarkan tampilan layar. AI juga terbukti mampu memainkan permainan catur secara langsung melalui kombinasi penglihatan visual, penalaran logika, serta komunikasi yang lancar.

Penalaran Mendalam Varian Extended Thinking

Bagi kebutuhan analisis yang memerlukan pemikiran ekstra, varian Extended Thinking mampu berpikir dan berbicara secara bersamaan tanpa menghentikan aliran dialog. Model ini menggunakan petunjuk verbal awal seperti kalimat “Let me check that…” untuk merespons masukan secara alami, lalu memberikan narasi perkembangan secara langsung saat membimbing pengguna melewati tugas latar belakang multi-langkah.

  • Mengubah sketsa mentah dan masukan suara menjadi komponen kode program React yang siap pakai secara langsung.
  • Mengordinasikan proses pemesanan multi-langkah serta pemanggilan fungsi asinkron tanpa memutus aliran percakapan alami.
  • Menyusun dokumen rencana bisnis utuh hingga paket perangkat pemasaran khusus hanya melalui instruksi suara yang interaktif.

Integrasi di Google Workspace dan Search

Penerapan fitur Gemini 3.8 Live membawa pengalaman berkolaborasi yang lebih intuitif saat pengguna menyelesaikan pekerjaan harian di dalam ekosistem layanan Google.

Pengguna dapat mencoba keunggulan Gemini 3.8 Live Extended Thinking langsung di dalam Docs Live, Gmail Live, dan Keep Live untuk membantu penyusunan dokumen maupun pengelolaan pesan.

Di samping itu, fitur penelusuran Search Live kini menyediakan bantuan pemecahan masalah teknis secara bertahap dan real time yang dipandu langsung oleh interaksi suara AI.

Cara Menggunakan Fitur Gemini 3.8 Live Lewat API Pengembang

Bagi para pengembang peranti lunak yang ingin mengintegrasikan agen suara cerdas ke dalam aplikasi buatan sendiri, pengaksesan antarmuka Gemini Live API dapat dilakukan melalui berbagai platform mitra penunjang.

  • Akses platform penyedia infrastruktur media seperti Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel, atau Vision Agents.
  • Hubungkan kunci akses API dari platform Gemini Enterprise Agent Platform ke dalam proyek aplikasi Anda.
  • Manfaatkan infrastruktur pemrosesan media real time yang dikelola otomatis oleh platform penyedia di latar belakang.
  • Rancang alur komunikasi dan instruksi pemanggilan alat (tool calling) sesuai kebutuhan bisnis Anda.
  • Uji keterhubungan agen suara untuk menangani instruksi navigasi, pencarian data, maupun integrasi sistem eksternal.

Kolaborasi strategis juga dilakukan bersama perusahaan global seperti Salesforce, Genspark, dan Lumeris yang memanfaatkan keunggulan latensi rendah, kelancaran dialog, serta kemampuan eksekusi pemanggilan fungsi dari model baru ini.

Perlindungan Keamanan dan Transparansi Melalui Watermark SynthID

Guna menjamin transparansi publik dan mencegah penyebaran informasi palsu, seluruh keluaran suara yang dihasilkan oleh produk AI ini telah dilindungi dengan sistem penanda digital SynthID.

Penanda khusus ini disematkan secara tidak kasatmata langsung ke dalam berkas audio keluaran, sehingga keberadaan konten buatan kecerdasan buatan tetap dapat dideteksi oleh sistem keamanan. Pendekatan ini menjadi komitmen utama dalam menjaga standar keselamatan serta keandalan penggunaan teknologi di masyarakat luas.