Layar Voice dan Konten di Layar
Buka di CMSDi halaman ini Anda menentukan apa yang dilihat user saat berbicara dengan agent Anda: tampilan immersive layar penuh atau transkrip, teks sambutan di layar yang masih kosong, lampiran selama panggilan, dan konten mana yang tampil di layar (canvas) alih-alih diucapkan.
Semua pengaturan ini ada di halaman Agent Voice (Conversation โ Voice di sidebar CMS) dan hanya muncul saat Voice conversations menyala.
Sebelum memulai
- Nyalakan Voice conversations di halaman Berbicara dengan Suara.
- Untuk lampiran selama panggilan, atur apa yang boleh dilampirkan user di Model & Context โ Attachments.
Voice screen style
Ada di card Turn on voice. Mengatur bagaimana sesi voice ditampilkan saat dimulai:

| Nilai | Yang dilihat user |
|---|---|
| Immersive (default) | Tampilan layar penuh khusus suara: animasi gelombang suara yang bereaksi terhadap siapa yang sedang berbicara, tanpa teks transkrip yang terlihat. Grafik, tabel, dan sumber yang dikutip selama panggilan muncul sebagai halaman yang bisa digeser di canvas pager. |
| Transcript | Tampilan bergaya teks: percakapan lisan ditampilkan sebagai transkrip bubble chat yang bisa di-scroll, sama seperti thread chat biasa, dengan sitasi yang bisa diklik dan kotak teks untuk mengetik di tengah panggilan. |
Ini hanya titik awal: end user tetap bisa berpindah ke tampilan lain dari preferensi mereka sendiri setelah panggilan berjalan.
Welcome message
Juga ada di card Turn on voice. Teks bebas yang ditampilkan di tampilan immersive selama canvas masih kosong, sebelum ada halaman grafik, tabel, atau sumber yang muncul. Biarkan kosong untuk memakai placeholder bawaan ("Speak to the assistant. Charts, tables and sources will appear here as pages you can browse.").
Jangan tertukar dengan Welcome Message di halaman Introduction: yang itu menyapa user di chat, dan juga yang diucapkan oleh sampel suara pada pengaturan Assistant's voice.
Lampiran selama panggilan immersive
Di tampilan immersive, tombol attach berada di sebelah kanan mikrofon. User bisa memilih gambar atau dokumen (di ponsel: Camera, Photo, atau Files), dan lampiran itu muncul sebagai pratinjau kecil di atas kontrol panggilan, sama seperti kotak yang ditampilkan input chat.
Tidak ada tombol kirim dalam voice call, jadi lampiran menunggu: lampiran dikirim ke asisten bersama hal berikutnya yang diucapkan user (atau, dalam push-to-talk, saat mereka melepas tombol bicara), dan pratinjaunya hilang setelah terkirim. Sampai saat itu user bisa menghapusnya. Asisten lalu menjawab pertanyaan lisan tersebut sambil melihat file itu, misalnya "berapa nomor pelat di struk ini?" dengan foto struk yang dilampirkan.
Apa yang boleh dilampirkan diatur di Model & Context โ Attachments: Allow Image Upload, Allow Document/File Upload, dan Document Upload Restrictions yang sama dengan yang berlaku untuk chat, diperiksa dengan cara yang sama saat file diunggah.
Beberapa perbedaan dari chat yang perlu diketahui:
- Gambar bergantung pada conversation style. Dengan Turn-by-turn, gambar selalu berfungsi: voice membaca gambar sendiri, apa pun conversation model yang dipakai agent untuk chat. Dalam Natural conversation, voice tidak bisa melihat gambar: gambar dikirim ke Answering AI model, dan selama masa beta hanya sebagian Answering AI model yang menerima gambar dalam panggilan. Jika tidak bisa, tombol attach hanya menawarkan dokumen.
- Dokumen dibaca sebagai teks, persis seperti di chat. Karena sesi voice menampung konteks jauh lebih sedikit daripada percakapan teks, hanya sekitar 12.000 karakter pertama dari sebuah dokumen (24.000 untuk seluruh file yang dikirim bersamaan) yang sampai ke asisten. Asisten diberi tahu bila sebuah dokumen dipersingkat, sehingga ia bisa menyampaikan bahwa jawabannya mungkin ada di bagian yang tidak ia lihat. Teks lengkapnya tetap tercatat di conversation. Dalam Natural conversation, teks dikirim ke Answering AI model: sekitar 8.000 karakter pertama dari setiap dokumen untuk model bawaan Qlar, sedangkan custom model menerima dokumen dengan cara yang sama seperti di chat.
- Lampiran dicatat pada conversation bersama pesan user yang dikirim bersamanya, sehingga muncul di riwayat conversation seperti lampiran chat.
On-screen content
Selama voice call, sebagian konten lebih baik ditampilkan di layar (canvas) daripada diucapkan: grafik, tabel, daftar panjang, kode, matematika, kitab suci, atau apa pun yang janggal bila dibacakan. Pengaturan ini mengontrol kapan asisten AI menampilkan konten ke canvas alih-alih langsung mengucapkannya. Pengaturan ini hanya berlaku untuk voice call; pengaturan Charts dan Table di halaman Chat tidak berlaku di sini.

Di WhatsApp, asisten bisa mengirim apa yang sedang ada di canvas sebagai pesan WhatsApp di tengah panggilan. Jika organization menyalakan Mode Privasi, fitur ini dimatikan.
Let the assistant decide
Saat menyala, AI memutuskan sendiri, dari satu respons ke respons berikutnya, bagian mana yang diucapkan secara percakapan dan bagian mana yang ditampilkan di canvas, tidak terbatas pada grafik dan tabel. Biarkan mati jika Anda lebih suka hanya mengandalkan daftar eksplisit di bawah.
Always show on screen (never spoken)
Daftar jenis konten berupa teks bebas (misalnya chart, table, arabic scripture, mathematical formula, cards) yang selalu harus ditampilkan di canvas alih-alih diucapkan sebagai teks biasa, setiap kali sebuah respons mengandung jenis konten tersebut. Ini berlaku terlepas dari apakah Let the assistant decide menyala atau tidak.
Pilih sebuah saran atau ketik jenis konten Anda sendiri lalu tekan Enter; hapus dengan ร pada chip-nya. Ini hanya mengubah di mana konten ditampilkan: agent tetap mengucapkan penjelasan apa pun yang dibutuhkan jawaban di sampingnya.
Immersive view instructions
Field What the assistant should do in the immersive view adalah teks bebas yang ditambahkan ke instruksi asisten AI hanya untuk panggilan yang ditonton user dalam tampilan immersive. Panggilan yang ditampilkan sebagai transkrip tidak pernah menerimanya, karena di sana jawabannya sudah bisa dibaca sebagai teks; instruksi yang ditulis untuk layar tanpa teks untuk dibaca ("tampilkan, jangan ucapkan") justru akan bertentangan dengan hal itu.

Tulis sebagai instruksi untuk asisten, bukan sebagai teks yang dilihat user. Contoh:
Setiap kali Anda menjelaskan data yang Anda cari di database, selalu tampilkan di layar sebagai grafik atau tabel, dan buat yang Anda ucapkan tetap berupa ringkasan singkat.
Jika instruksi ini bertentangan dengan pengaturan On-screen content di atas, instruksi inilah yang menang, karena ditambahkan paling akhir. Biarkan field kosong agar tidak ada yang ditambahkan sama sekali.
Karena Voice screen style hanyalah titik awal, agent yang diatur ke Transcript tetap bisa punya user yang berpindah sendiri ke tampilan immersive, dan mereka akan mendapatkan instruksi ini; halaman ini memberi tahu hal tersebut bila itu default yang Anda atur.
Dalam Natural conversation, instruksi ini juga memandu Answering AI model, yang menyiapkan apa yang ditampilkan di layar. Voice itu sendiri hanya menerima sekitar 4.000 karakter pertama, dan halaman ini memberi peringatan bila teksnya lebih panjang.
Periksa hasilnya
- Klik Save.
- Mulai percakapan voice di preview (menu + di samping input chat). Panggilan seharusnya terbuka dalam voice screen style yang Anda pilih, dan menampilkan welcome message Anda selama canvas masih kosong.
- Minta sesuatu yang cocok ditampilkan di layar, seperti tabel atau grafik dari data yang bisa dicari agent Anda. Konten itu seharusnya muncul sebagai halaman di canvas sementara asisten mengucapkan penjelasan singkat.
- Jika lampiran diizinkan, lampirkan gambar atau dokumen lalu ajukan pertanyaan tentangnya.
Langkah berikutnya
- Pengaturan Natural Conversation: jika Anda memakai Natural conversation.
- Berikutnya dalam alur: Mengingat Setiap Pengguna.
- Kembali ke Berbicara dengan Suara untuk conversation style dan billing.