Mencari dan Membaca Web
Buka di CMSAgent Anda menjawab pertanyaan berdasarkan knowledge base yang Anda berikan. Tetapi kadang informasi yang dibutuhkan user memang tidak ada di dokumen Anda: informasi itu ada di internet terbuka, atau di website tertentu yang berubah setiap hari. Fitur Web Search dan Web Scraping memungkinkan agent Anda menjangkau lebih jauh dari knowledge base statisnya dan mengambil konten live dari web selama percakapan.
Apa Itu Web Search?
Web Search memberi agent Anda kemampuan melakukan pencarian internet secara real-time selama percakapan. Saat user mengajukan pertanyaan yang tidak bisa dijawab agent dari knowledge base-nya, agent bisa diam-diam mengirim query ke mesin pencari, mengambil daftar hasil yang sudah diurutkan, lalu memakai hasil tersebut untuk menyusun jawaban yang berdasar dan terkini, semuanya dalam giliran chat yang sama.
Bayangkan agent Anda punya akses ke mesin pencari yang ia konsultasikan secara otomatis, tanpa user perlu meninggalkan percakapan.
Kapan memakai Web Search
- Agent Anda perlu menjawab pertanyaan tentang peristiwa terkini, harga, atau apa pun yang berubah seiring waktu
- Anda ingin mengurangi beban menjaga knowledge base tetap mutakhir
- Agent Anda menangani topik yang luas dan Anda tidak bisa mengantisipasi setiap pertanyaan
Apa Itu Web Scraping?
Web Scraping melangkah lebih jauh. Alih-alih mengembalikan daftar cuplikan hasil pencarian, fitur ini mengambil seluruh konten halaman web tertentu dan mengubahnya menjadi markdown yang bersih dan mudah dibaca. Agent lalu memakai konten hasil ekstraksi itu untuk menjawab pertanyaan user secara detail.
Ini sangat berguna saat user membagikan URL atau saat agent perlu membaca halaman yang sebenarnya (daftar produk, artikel berita, halaman dokumentasi), bukan sekadar tahu bahwa halaman itu ada.
Kapan memakai Web Scraping
- User membagikan URL dan berharap agent merangkum atau menjawab pertanyaan tentang halaman tersebut
- Anda ingin agent membaca teks lengkap sebuah halaman, bukan hanya cuplikan hasil pencarian
- Agent Anda perlu memproses halaman terstruktur seperti dokumentasi, spesifikasi produk, atau postingan blog
Perbandingan Kedua Fitur
| Web Search | Web Scraping | |
|---|---|---|
| Yang diambil | Daftar cuplikan hasil dari mesin pencari, sudah diurutkan | Seluruh konten teks dari halaman web tertentu |
| Dipicu oleh | Pertanyaan yang tidak bisa dijawab agent dari knowledge base-nya | URL yang dibagikan dalam percakapan, atau kebutuhan akan konten satu halaman penuh |
| Format output | Ringkasan hasil pencarian | Konten halaman dalam format markdown |
| Pembatasan domain | Whitelist hingga 20 domain | Kecualikan path/tipe file tertentu |
| Penanganan gambar | Tidak berlaku | Filter ukuran yang bisa diatur |
| Paling cocok untuk | Pertanyaan faktual real-time | Membaca satu halaman tertentu secara mendalam |
Kedua fitur bisa aktif bersamaan dan dalam praktiknya saling melengkapi.
Manfaat
Manfaat Web Search
- Selalu terkini: agent menampilkan informasi terbaru tanpa perlu memperbarui knowledge base secara manual
- Cakupan lebih luas: menangani pertanyaan di luar cakupan dokumen yang Anda kurasi
- Sumber yang transparan: jawaban bisa menyertakan referensi tempat informasi ditemukan
- Filter domain: Anda bisa membatasi pencarian hanya ke domain tepercaya, agar jawaban tetap sesuai brand dan andal
Manfaat Web Scraping
- Pemahaman konten penuh: agent membaca halaman yang sebenarnya, bukan hanya ringkasannya
- Percakapan yang mengenali URL: user bisa menempelkan link dan langsung meminta agent menjelaskan atau merangkumnya
- Presisi markdown: konten diekstrak sebagai teks terstruktur yang bersih, mengurangi gangguan dari iklan dan elemen navigasi
- Kontrol gambar: Anda bisa menyertakan atau mengecualikan gambar dan memfilternya berdasarkan ukuran file agar tidak mengunduh aset yang tidak relevan
Risiko dan Pertimbangan
Catatan: Kedua fitur mengirim request keluar ke website eksternal saat percakapan berlangsung. Pahami konsekuensinya sebelum mengaktifkannya di production.
Risiko Web Search
| Risiko | Keterangan |
|---|---|
| Sumber yang tidak akurat | Hasil pencarian bisa memuat halaman dengan informasi yang salah atau usang. Kurangi risikonya dengan hanya memasukkan domain tepercaya ke whitelist. |
| Hasil yang tidak relevan | Tanpa whitelist domain, agent bisa memakai konten yang tidak relevan dengan kebutuhan Anda. |
| Latensi | Setiap pencarian menambah satu perjalanan jaringan ke waktu respons. Atur maxWebSearchResults secara hemat dan pilih Search Depth yang lebih dangkal untuk menekan latensi. |
| Kebocoran data | Query user dikirim ke mesin pencari. Hindari mengaktifkan Web Search untuk agent yang memproses informasi rahasia atau data pribadi. |
Risiko Web Scraping
| Risiko | Keterangan |
|---|---|
| Ketentuan layanan | Sebagian website melarang scraping otomatis. Pastikan situs yang diakses agent Anda mengizinkan pengambilan konten secara terprogram. |
| Konten dinamis | Halaman yang sepenuhnya dibangun dengan JavaScript mungkin tidak dirender dengan benar dalam batas timeout yang diatur. |
| Payload berlebihan | Halaman besar dengan banyak gambar bisa memperlambat respons. Pakai filter ukuran gambar dan daftar path yang diabaikan untuk mengatur apa yang diambil. |
| Paparan konten sensitif | Jika user memberikan URL ke halaman internal atau sensitif, agent akan mencoba membacanya. Pertimbangkan audiens Anda sebelum mengaktifkan fitur ini. |
Sebelum memulai
Sebelum mengatur salah satu fitur, pastikan hal-hal berikut:
- Anda sudah punya agent. Jika belum, ikuti Membuat Agent Pertama Anda terlebih dahulu.
- Agent Anda sudah menjawab dengan baik dari sumbernya sendiri. Selesaikan dulu Mengajari Agent Anda, agar web mengisi celah, bukan menggantikan knowledge base Anda.
- Anda tahu cara menguji dan mem-publish perubahan. Lihat Preview dan Publish Perubahan.
- Anda sign in sebagai Owner atau Contributor agent tersebut. Viewer tidak bisa mengakses setelan ini.
- Anda tahu agent mana yang ingin diatur. Buka dari daftar agent agar agent itu menjadi agent yang aktif.
Bagian 1: Mengatur Web Search
Langkah 1: Buka Setelan Web Search
Di sidebar kiri halaman detail agent Anda, buka menu Tools lalu klik Web Search.
Halaman ini punya dua bagian: Web Search Configuration dan Domain Whitelist.
Langkah 2: Aktifkan Web Search
Di bagian atas Web Search Configuration, Anda akan melihat toggle Enable Web Search. Secara default toggle ini nonaktif.
Geser toggle ke posisi on. Kontrol lain di halaman akan menjadi aktif.
Tip: Jika ingin menguji fitur ini tanpa memengaruhi user sungguhan, aktifkan dulu di agent uji.
Langkah 3: Atur Jumlah Maksimum Hasil Pencarian
Field Max Web Search Results menentukan berapa banyak hasil pencarian yang diambil agent per query. Default-nya 3.
| Nilai | Efek |
|---|---|
1 | Respons paling cepat, tetapi konteks yang bisa dipakai agent terbatas |
3 (default) | Keseimbangan yang baik antara kecepatan dan kualitas jawaban |
| Nilai lebih tinggi | Konteks lebih kaya tetapi respons lebih lambat karena data yang diambil bertambah |
Sesuaikan angka ini dengan toleransi Anda terhadap latensi respons dan kompleksitas pertanyaan yang ditangani agent. Untuk sebagian besar kebutuhan, pertahankan nilainya antara 3 dan 5.
Catatan: Di halaman ini juga ada toggle Allow User Control. Saat ini toggle tersebut bertanda Coming Soon dan belum bisa diaktifkan. Fitur ini nantinya memungkinkan end user menyalakan atau mematikan web search selama percakapan; saat ini belum tersedia.
Langkah 4: Pilih Search Depth
Dropdown Search Depth menentukan seberapa menyeluruh setiap query dikerjakan. Jika Max Web Search Results menentukan berapa banyak halaman yang kembali, setelan ini menentukan seberapa keras pencarian berusaha menemukannya.
| Depth | Efek |
|---|---|
| Fast | Latensi dan biaya paling rendah. Paling cocok untuk agent yang sering mencari, dan untuk percakapan voice, tempat jeda jauh lebih terasa dibanding di chat |
| Balanced (default) | Pencarian memilih strateginya sendiri per query. Titik awal yang masuk akal untuk sebagian besar agent |
| Deep | Paling menyeluruh dan paling mahal. Cocok untuk agent bergaya riset yang menjawab pertanyaan di mana kelengkapan lebih penting daripada kecepatan |
Pencarian yang lebih dalam lebih mahal per query, dan biayanya dibebankan ke credit organization Anda. Jika agent Anda mencari di hampir setiap giliran, mulailah dari Fast atau Balanced dan hanya pindah ke Deep jika jawabannya memang kurang memadai.
Langkah 5: Batasi ke Domain Tertentu (Opsional)
Secara default, Web Search mencari di internet terbuka. Jika Anda ingin membatasi hasil ke website tepercaya tertentu, pakai bagian Domain Whitelist.
Klik Add New Domain untuk menambah entri. Masukkan nama domain tanpa awalan protokol.
| โ Format yang benar | โ Format yang salah |
|---|---|
wikipedia.org | https://wikipedia.org |
docs.microsoft.com | http://docs.microsoft.com/ |
support.qlar.com | www.support.qlar.com |
Nama domain harus mengandung setidaknya satu titik dan hanya memakai huruf, angka, tanda hubung, garis bawah, dan titik. Anda bisa menambahkan hingga 20 domain.
Jika whitelist tidak kosong, agent membatasi semua pencarian hanya ke domain yang tercantum. Membiarkan whitelist kosong berarti pencarian dilakukan di seluruh internet.
Untuk menghapus domain, klik ikon hapus di sebelah kanan entrinya.
Tip: Mulailah dengan whitelist kecil berisi dua atau tiga sumber yang otoritatif. Anda selalu bisa menambahkannya nanti. Whitelist yang dikurasi sangat mengurangi kemungkinan agent mengutip konten yang tidak akurat atau tidak relevan.
Langkah 6: Simpan Setelan Web Search
Klik tombol Save di bagian bawah halaman. Perubahan Anda disimpan sebagai draft: Anda bisa langsung mencobanya di preview, dan user sungguhan mendapatkannya setelah Anda mengklik Publish.
Bagian 2: Mengatur Web Scraping
Langkah 1: Buka Setelan Web Scraping
Di sidebar kiri, masih di bawah menu Tools, klik Web Scraping.
Halaman ini terbagi menjadi tiga bagian: Web Scraping Configuration, Image Size Filters, dan Ignored Paths.
Langkah 2: Aktifkan Web Scraping
Di bagian atas Web Scraping Configuration, geser toggle Enable Web Scraping ke on. Semua kontrol lain akan aktif.
Langkah 3: Atur Timeout Pemuatan Halaman
Field Timeout (seconds) menentukan waktu maksimum agent menunggu sebuah halaman selesai dimuat sebelum menyerah. Default-nya 30 detik.
| Skenario | Nilai yang disarankan |
|---|---|
| Halaman cepat yang didominasi teks (dokumentasi, blog) | 15 โ 20 |
| Halaman standar | 30 (default) |
| Halaman berat dengan banyak resource | 45 โ 60 |
Nilai minimum yang diizinkan adalah 5 detik dan maksimum 60 detik. Timeout yang terlalu rendah akan menyebabkan pengambilan sebagian atau gagal pada halaman yang lebih lambat. Timeout yang terlalu tinggi akan menambah latensi respons saat halaman tidak bisa dijangkau.
Langkah 4: Atur Setelan Gambar
Web Scraping bisa menyertakan atau mengecualikan gambar dari markdown hasil ekstraksi. Bagian ini punya tiga kontrol.
Toggle Include Images
Jika aktif, gambar yang ditemukan di halaman disertakan dalam output markdown. Jika nonaktif, semua gambar dibuang. Nonaktifkan ini jika agent Anda hanya butuh konten teks halaman; ukuran respons akan berkurang secara signifikan.
Min Image Size (KB)
Gambar yang lebih kecil dari batas ini dikecualikan. Default-nya 5 KB. Ini menyaring ikon, tracking pixel, dan gambar dekoratif kecil lain yang menambah gangguan tanpa memberi nilai.
Max Image Size (MB)
Gambar yang lebih besar dari batas ini dikecualikan. Default-nya 10 MB. Ini mencegah agent mengunduh gambar yang sangat besar yang memperlambat ekstraksi tanpa meningkatkan kualitas jawaban.
| Setelan | Minimum | Maksimum | Default |
|---|---|---|---|
| Min Image Size | 1 KB | 10.240 KB (10 MB) | 5 KB |
| Max Image Size | 1 MB | 50 MB | 10 MB |
Tip: Jika konten gambar tidak penting untuk kebutuhan Anda, nonaktifkan Include Images. Ini cara paling efektif untuk mempercepat respons web scraping.
Langkah 5: Kecualikan Path Tertentu (Opsional)
Bagian Ignored Paths memungkinkan Anda mendefinisikan pola path yang harus dilewati scraper. Ini berguna untuk mengecualikan aset statis, file media, atau bagian situs yang tidak berguna bagi agent Anda.
Klik Add New Path Pattern untuk menambah entri. Setiap pola bisa berbentuk salah satu dari berikut:
| Jenis pola | Contoh | Yang dikecualikan |
|---|---|---|
| Path absolut | /icons | Semua konten di bawah path /icons/ |
| Wildcard berdasarkan ekstensi | *.svg | Semua file SVG, apa pun path-nya |
| Nama file tertentu | logo.png | File apa pun yang bernama logo.png |
Anda bisa menambahkan hingga 50 pola. Setiap pola tidak boleh lebih dari 200 karakter.
Untuk menghapus pola, klik ikon hapus di sebelah kanan entrinya.
Tip: Pola yang umum dikecualikan:
*.svg,*.ico,*.woff,*.woff2,/cdn-cgi,/wp-content/uploads. Biasanya ini aset yang tidak perlu dibaca agent.
Langkah 6: Konfirmasi dan Simpan
Klik tombol Save di bagian bawah halaman.
Berbeda dengan Web Search, Web Scraping menampilkan dialog konfirmasi sebelum menerapkan setelan Anda. Tinjau ringkasannya lalu klik Confirm untuk melanjutkan. Langkah tambahan ini ada karena setelan Web Scraping memengaruhi cara agent memproses konten eksternal, yang bisa berdampak nyata pada kualitas jawaban dan latensi.
Seperti Web Search, setelan baru disimpan sebagai draft. Setelan itu sampai ke user sungguhan setelah Anda mengklik Publish.
Memakai Kedua Fitur Bersamaan
Web Search dan Web Scraping bekerja secara terpisah, tetapi saling melengkapi dalam alur percakapan:
- User mengajukan pertanyaan yang tidak bisa dijawab agent dari knowledge base-nya
- Web Search menemukan URL hasil yang paling relevan
- Web Scraping mengambil seluruh konten dari hasil teratas
- Agent menyusun jawaban yang detail dan bersumber dari teks halaman lengkap
Mengaktifkan kedua fitur bersamaan memberi agent Anda akses seluas mungkin ke informasi live. Namun, setiap fitur menambah latensi dan ketergantungan pada pihak eksternal. Mulailah dengan Web Search saja, ukur dampaknya pada waktu respons, lalu tambahkan Web Scraping saat Anda butuh ekstraksi konten yang lebih dalam.
Kesalahan Umum yang Perlu Dihindari
| Kesalahan | Mengapa penting | Solusi |
|---|---|---|
| Membiarkan whitelist domain kosong dalam konteks bisnis | Agent bisa mengutip sumber yang tidak andal | Tambahkan daftar kurasi berisi 2โ5 domain tepercaya |
| Mengatur Max Results di atas 5 | Nilai lebih tinggi menambah latensi secara nyata | Pertahankan di 3โ5 kecuali kedalaman jawaban sangat penting |
| Mengaktifkan Include Images tanpa filter ukuran | Gambar besar memperlambat ekstraksi secara signifikan | Atur Max Image Size 2โ5 MB untuk pemakaian umum |
| Memakai timeout di bawah 10 detik | Timeout yang terlalu cepat sering menyebabkan scraping gagal | Pakai 20โ30 detik sebagai patokan |
| Mengaktifkan Web Scraping untuk percakapan rahasia | User bisa membagikan URL apa pun, termasuk halaman internal | Aktifkan scraping hanya jika audiens dan kontennya sesuai |
| Tidak menguji setelah konfigurasi | Setelan mungkin tidak bekerja seperti yang diharapkan di semua situs | Uji dengan 3โ5 URL yang representatif sebelum go live |
Periksa hasilnya
- Buka panel preview di sisi kanan CMS (atau klik Preview di top bar).
- Ajukan pertanyaan yang tidak bisa dijawab knowledge base Anda, misalnya tentang berita hari ini atau harga terkini. Agent seharusnya menjawab dengan informasi dari web.
- Tempelkan URL publik dan minta agent merangkumnya. Ini menguji Web Scraping.
- Jika Anda sudah puas dengan jawabannya, klik Publish agar user sungguhan mendapatkan perubahan tersebut. Lihat Preview dan Publish Perubahan.
Langkah berikutnya
- Berikutnya dalam jalur ini: Menghubungkan API Anda, agar agent bisa membaca dan bertindak atas data di sistem Anda sendiri.
- Menggunakan Plugin: perluas agent Anda dengan plugin siap pakai untuk operasi umum.
- Analitik & Log: lihat bagaimana agent Anda memakai konten web dalam percakapan nyata.