Google DeepMind memperkenalkan Gemini 3.8 Live dan Gemini 3.8 Live Extended Thinking untuk pengalaman interaksi realtime. Model voice seperti ini berusaha membuat percakapan dengan AI terasa lebih alami, termasuk merespons dengan jeda yang lebih masuk akal dan mempertahankan konteks saat dialog berlangsung.
Perubahan tersebut menarik bagi developer yang membangun customer support, tutor digital, asisten meeting, atau aplikasi hands-free. Namun voice agent memiliki masalah yang berbeda dari chatbot teks. Pengguna bisa menyela, berbicara bersamaan, mengubah maksud di tengah kalimat, atau berhenti tanpa memberikan penutup yang jelas.
Latency menjadi bagian dari pengalaman
Dalam percakapan suara, keterlambatan beberapa detik terasa lebih mengganggu daripada pada chat biasa. Aplikasi perlu mengukur waktu dari audio masuk, transkripsi, pemrosesan model, hingga audio balasan diterima. Streaming dapat membantu, tetapi harus diimbangi dengan mekanisme untuk membatalkan respons ketika pengguna mulai berbicara lagi.
Pengelolaan sesi juga penting. Transkrip, audio, dan konteks percakapan perlu memiliki kebijakan retensi yang jelas. Untuk layanan publik atau customer support, pengguna harus mengetahui kapan mereka sedang berbicara dengan AI dan bagaimana meminta bantuan manusia.
Bukan hanya suara yang terdengar natural
Voice experience yang baik harus memahami batas. Agent perlu meminta klarifikasi ketika konteks kurang, memberi tanda ketika tidak yakin, dan menghentikan tool berisiko sampai ada konfirmasi. Dengan begitu, kelancaran percakapan tidak mengorbankan akurasi maupun kendali pengguna.
Sumber: https://deepmind.google/blog/introducing-gemini-3-8-live-and-3-8-live-extended-thinking/
Transparansi: Artikel ini disusun bersama Codekop AI berdasarkan sumber yang tercantum, kemudian ditinjau dan disunting oleh Fauzan Falah. AI dapat keliru, jadi silakan cek kembali sumber asli.