Mencari dan Membaca Web

Buka di CMS

Agent Anda menjawab pertanyaan berdasarkan knowledge base yang Anda berikan. Tetapi kadang informasi yang dibutuhkan user memang tidak ada di dokumen Anda: informasi itu ada di internet terbuka, atau di website tertentu yang berubah setiap hari. Fitur Web Search dan Web Scraping memungkinkan agent Anda menjangkau lebih jauh dari knowledge base statisnya dan mengambil konten live dari web selama percakapan.


Web Search memberi agent Anda kemampuan melakukan pencarian internet secara real-time selama percakapan. Saat user mengajukan pertanyaan yang tidak bisa dijawab agent dari knowledge base-nya, agent bisa diam-diam mengirim query ke mesin pencari, mengambil daftar hasil yang sudah diurutkan, lalu memakai hasil tersebut untuk menyusun jawaban yang berdasar dan terkini, semuanya dalam giliran chat yang sama.

Bayangkan agent Anda punya akses ke mesin pencari yang ia konsultasikan secara otomatis, tanpa user perlu meninggalkan percakapan.

  • Agent Anda perlu menjawab pertanyaan tentang peristiwa terkini, harga, atau apa pun yang berubah seiring waktu
  • Anda ingin mengurangi beban menjaga knowledge base tetap mutakhir
  • Agent Anda menangani topik yang luas dan Anda tidak bisa mengantisipasi setiap pertanyaan

Apa Itu Web Scraping?

Web Scraping melangkah lebih jauh. Alih-alih mengembalikan daftar cuplikan hasil pencarian, fitur ini mengambil seluruh konten halaman web tertentu dan mengubahnya menjadi markdown yang bersih dan mudah dibaca. Agent lalu memakai konten hasil ekstraksi itu untuk menjawab pertanyaan user secara detail.

Ini sangat berguna saat user membagikan URL atau saat agent perlu membaca halaman yang sebenarnya (daftar produk, artikel berita, halaman dokumentasi), bukan sekadar tahu bahwa halaman itu ada.

Kapan memakai Web Scraping

  • User membagikan URL dan berharap agent merangkum atau menjawab pertanyaan tentang halaman tersebut
  • Anda ingin agent membaca teks lengkap sebuah halaman, bukan hanya cuplikan hasil pencarian
  • Agent Anda perlu memproses halaman terstruktur seperti dokumentasi, spesifikasi produk, atau postingan blog

Perbandingan Kedua Fitur

Web SearchWeb Scraping
Yang diambilDaftar cuplikan hasil dari mesin pencari, sudah diurutkanSeluruh konten teks dari halaman web tertentu
Dipicu olehPertanyaan yang tidak bisa dijawab agent dari knowledge base-nyaURL yang dibagikan dalam percakapan, atau kebutuhan akan konten satu halaman penuh
Format outputRingkasan hasil pencarianKonten halaman dalam format markdown
Pembatasan domainWhitelist hingga 20 domainKecualikan path/tipe file tertentu
Penanganan gambarTidak berlakuFilter ukuran yang bisa diatur
Paling cocok untukPertanyaan faktual real-timeMembaca satu halaman tertentu secara mendalam

Kedua fitur bisa aktif bersamaan dan dalam praktiknya saling melengkapi.


Manfaat

  • Selalu terkini: agent menampilkan informasi terbaru tanpa perlu memperbarui knowledge base secara manual
  • Cakupan lebih luas: menangani pertanyaan di luar cakupan dokumen yang Anda kurasi
  • Sumber yang transparan: jawaban bisa menyertakan referensi tempat informasi ditemukan
  • Filter domain: Anda bisa membatasi pencarian hanya ke domain tepercaya, agar jawaban tetap sesuai brand dan andal

Manfaat Web Scraping

  • Pemahaman konten penuh: agent membaca halaman yang sebenarnya, bukan hanya ringkasannya
  • Percakapan yang mengenali URL: user bisa menempelkan link dan langsung meminta agent menjelaskan atau merangkumnya
  • Presisi markdown: konten diekstrak sebagai teks terstruktur yang bersih, mengurangi gangguan dari iklan dan elemen navigasi
  • Kontrol gambar: Anda bisa menyertakan atau mengecualikan gambar dan memfilternya berdasarkan ukuran file agar tidak mengunduh aset yang tidak relevan

Risiko dan Pertimbangan

Catatan: Kedua fitur mengirim request keluar ke website eksternal saat percakapan berlangsung. Pahami konsekuensinya sebelum mengaktifkannya di production.

RisikoKeterangan
Sumber yang tidak akuratHasil pencarian bisa memuat halaman dengan informasi yang salah atau usang. Kurangi risikonya dengan hanya memasukkan domain tepercaya ke whitelist.
Hasil yang tidak relevanTanpa whitelist domain, agent bisa memakai konten yang tidak relevan dengan kebutuhan Anda.
LatensiSetiap pencarian menambah satu perjalanan jaringan ke waktu respons. Atur maxWebSearchResults secara hemat dan pilih Search Depth yang lebih dangkal untuk menekan latensi.
Kebocoran dataQuery user dikirim ke mesin pencari. Hindari mengaktifkan Web Search untuk agent yang memproses informasi rahasia atau data pribadi.

Risiko Web Scraping

RisikoKeterangan
Ketentuan layananSebagian website melarang scraping otomatis. Pastikan situs yang diakses agent Anda mengizinkan pengambilan konten secara terprogram.
Konten dinamisHalaman yang sepenuhnya dibangun dengan JavaScript mungkin tidak dirender dengan benar dalam batas timeout yang diatur.
Payload berlebihanHalaman besar dengan banyak gambar bisa memperlambat respons. Pakai filter ukuran gambar dan daftar path yang diabaikan untuk mengatur apa yang diambil.
Paparan konten sensitifJika user memberikan URL ke halaman internal atau sensitif, agent akan mencoba membacanya. Pertimbangkan audiens Anda sebelum mengaktifkan fitur ini.

Sebelum memulai

Sebelum mengatur salah satu fitur, pastikan hal-hal berikut:

  • Anda sudah punya agent. Jika belum, ikuti Membuat Agent Pertama Anda terlebih dahulu.
  • Agent Anda sudah menjawab dengan baik dari sumbernya sendiri. Selesaikan dulu Mengajari Agent Anda, agar web mengisi celah, bukan menggantikan knowledge base Anda.
  • Anda tahu cara menguji dan mem-publish perubahan. Lihat Preview dan Publish Perubahan.
  • Anda sign in sebagai Owner atau Contributor agent tersebut. Viewer tidak bisa mengakses setelan ini.
  • Anda tahu agent mana yang ingin diatur. Buka dari daftar agent agar agent itu menjadi agent yang aktif.

Di sidebar kiri halaman detail agent Anda, buka menu Tools lalu klik Web Search.

Halaman ini punya dua bagian: Web Search Configuration dan Domain Whitelist.


Di bagian atas Web Search Configuration, Anda akan melihat toggle Enable Web Search. Secara default toggle ini nonaktif.

Geser toggle ke posisi on. Kontrol lain di halaman akan menjadi aktif.

Tip: Jika ingin menguji fitur ini tanpa memengaruhi user sungguhan, aktifkan dulu di agent uji.


Langkah 3: Atur Jumlah Maksimum Hasil Pencarian

Field Max Web Search Results menentukan berapa banyak hasil pencarian yang diambil agent per query. Default-nya 3.

NilaiEfek
1Respons paling cepat, tetapi konteks yang bisa dipakai agent terbatas
3 (default)Keseimbangan yang baik antara kecepatan dan kualitas jawaban
Nilai lebih tinggiKonteks lebih kaya tetapi respons lebih lambat karena data yang diambil bertambah

Sesuaikan angka ini dengan toleransi Anda terhadap latensi respons dan kompleksitas pertanyaan yang ditangani agent. Untuk sebagian besar kebutuhan, pertahankan nilainya antara 3 dan 5.

Catatan: Di halaman ini juga ada toggle Allow User Control. Saat ini toggle tersebut bertanda Coming Soon dan belum bisa diaktifkan. Fitur ini nantinya memungkinkan end user menyalakan atau mematikan web search selama percakapan; saat ini belum tersedia.


Langkah 4: Pilih Search Depth

Dropdown Search Depth menentukan seberapa menyeluruh setiap query dikerjakan. Jika Max Web Search Results menentukan berapa banyak halaman yang kembali, setelan ini menentukan seberapa keras pencarian berusaha menemukannya.

DepthEfek
FastLatensi dan biaya paling rendah. Paling cocok untuk agent yang sering mencari, dan untuk percakapan voice, tempat jeda jauh lebih terasa dibanding di chat
Balanced (default)Pencarian memilih strateginya sendiri per query. Titik awal yang masuk akal untuk sebagian besar agent
DeepPaling menyeluruh dan paling mahal. Cocok untuk agent bergaya riset yang menjawab pertanyaan di mana kelengkapan lebih penting daripada kecepatan

Pencarian yang lebih dalam lebih mahal per query, dan biayanya dibebankan ke credit organization Anda. Jika agent Anda mencari di hampir setiap giliran, mulailah dari Fast atau Balanced dan hanya pindah ke Deep jika jawabannya memang kurang memadai.


Langkah 5: Batasi ke Domain Tertentu (Opsional)

Secara default, Web Search mencari di internet terbuka. Jika Anda ingin membatasi hasil ke website tepercaya tertentu, pakai bagian Domain Whitelist.

Klik Add New Domain untuk menambah entri. Masukkan nama domain tanpa awalan protokol.

โœ… Format yang benarโŒ Format yang salah
wikipedia.orghttps://wikipedia.org
docs.microsoft.comhttp://docs.microsoft.com/
support.qlar.comwww.support.qlar.com

Nama domain harus mengandung setidaknya satu titik dan hanya memakai huruf, angka, tanda hubung, garis bawah, dan titik. Anda bisa menambahkan hingga 20 domain.

Jika whitelist tidak kosong, agent membatasi semua pencarian hanya ke domain yang tercantum. Membiarkan whitelist kosong berarti pencarian dilakukan di seluruh internet.

Untuk menghapus domain, klik ikon hapus di sebelah kanan entrinya.

Tip: Mulailah dengan whitelist kecil berisi dua atau tiga sumber yang otoritatif. Anda selalu bisa menambahkannya nanti. Whitelist yang dikurasi sangat mengurangi kemungkinan agent mengutip konten yang tidak akurat atau tidak relevan.


Klik tombol Save di bagian bawah halaman. Perubahan Anda disimpan sebagai draft: Anda bisa langsung mencobanya di preview, dan user sungguhan mendapatkannya setelah Anda mengklik Publish.


Bagian 2: Mengatur Web Scraping

Langkah 1: Buka Setelan Web Scraping

Di sidebar kiri, masih di bawah menu Tools, klik Web Scraping.

Halaman ini terbagi menjadi tiga bagian: Web Scraping Configuration, Image Size Filters, dan Ignored Paths.


Langkah 2: Aktifkan Web Scraping

Di bagian atas Web Scraping Configuration, geser toggle Enable Web Scraping ke on. Semua kontrol lain akan aktif.


Langkah 3: Atur Timeout Pemuatan Halaman

Field Timeout (seconds) menentukan waktu maksimum agent menunggu sebuah halaman selesai dimuat sebelum menyerah. Default-nya 30 detik.

SkenarioNilai yang disarankan
Halaman cepat yang didominasi teks (dokumentasi, blog)15 โ€“ 20
Halaman standar30 (default)
Halaman berat dengan banyak resource45 โ€“ 60

Nilai minimum yang diizinkan adalah 5 detik dan maksimum 60 detik. Timeout yang terlalu rendah akan menyebabkan pengambilan sebagian atau gagal pada halaman yang lebih lambat. Timeout yang terlalu tinggi akan menambah latensi respons saat halaman tidak bisa dijangkau.


Langkah 4: Atur Setelan Gambar

Web Scraping bisa menyertakan atau mengecualikan gambar dari markdown hasil ekstraksi. Bagian ini punya tiga kontrol.

Toggle Include Images

Jika aktif, gambar yang ditemukan di halaman disertakan dalam output markdown. Jika nonaktif, semua gambar dibuang. Nonaktifkan ini jika agent Anda hanya butuh konten teks halaman; ukuran respons akan berkurang secara signifikan.

Min Image Size (KB)

Gambar yang lebih kecil dari batas ini dikecualikan. Default-nya 5 KB. Ini menyaring ikon, tracking pixel, dan gambar dekoratif kecil lain yang menambah gangguan tanpa memberi nilai.

Max Image Size (MB)

Gambar yang lebih besar dari batas ini dikecualikan. Default-nya 10 MB. Ini mencegah agent mengunduh gambar yang sangat besar yang memperlambat ekstraksi tanpa meningkatkan kualitas jawaban.

SetelanMinimumMaksimumDefault
Min Image Size1 KB10.240 KB (10 MB)5 KB
Max Image Size1 MB50 MB10 MB

Tip: Jika konten gambar tidak penting untuk kebutuhan Anda, nonaktifkan Include Images. Ini cara paling efektif untuk mempercepat respons web scraping.


Langkah 5: Kecualikan Path Tertentu (Opsional)

Bagian Ignored Paths memungkinkan Anda mendefinisikan pola path yang harus dilewati scraper. Ini berguna untuk mengecualikan aset statis, file media, atau bagian situs yang tidak berguna bagi agent Anda.

Klik Add New Path Pattern untuk menambah entri. Setiap pola bisa berbentuk salah satu dari berikut:

Jenis polaContohYang dikecualikan
Path absolut/iconsSemua konten di bawah path /icons/
Wildcard berdasarkan ekstensi*.svgSemua file SVG, apa pun path-nya
Nama file tertentulogo.pngFile apa pun yang bernama logo.png

Anda bisa menambahkan hingga 50 pola. Setiap pola tidak boleh lebih dari 200 karakter.

Untuk menghapus pola, klik ikon hapus di sebelah kanan entrinya.

Tip: Pola yang umum dikecualikan: *.svg, *.ico, *.woff, *.woff2, /cdn-cgi, /wp-content/uploads. Biasanya ini aset yang tidak perlu dibaca agent.


Langkah 6: Konfirmasi dan Simpan

Klik tombol Save di bagian bawah halaman.

Berbeda dengan Web Search, Web Scraping menampilkan dialog konfirmasi sebelum menerapkan setelan Anda. Tinjau ringkasannya lalu klik Confirm untuk melanjutkan. Langkah tambahan ini ada karena setelan Web Scraping memengaruhi cara agent memproses konten eksternal, yang bisa berdampak nyata pada kualitas jawaban dan latensi.

Seperti Web Search, setelan baru disimpan sebagai draft. Setelan itu sampai ke user sungguhan setelah Anda mengklik Publish.


Memakai Kedua Fitur Bersamaan

Web Search dan Web Scraping bekerja secara terpisah, tetapi saling melengkapi dalam alur percakapan:

  1. User mengajukan pertanyaan yang tidak bisa dijawab agent dari knowledge base-nya
  2. Web Search menemukan URL hasil yang paling relevan
  3. Web Scraping mengambil seluruh konten dari hasil teratas
  4. Agent menyusun jawaban yang detail dan bersumber dari teks halaman lengkap

Mengaktifkan kedua fitur bersamaan memberi agent Anda akses seluas mungkin ke informasi live. Namun, setiap fitur menambah latensi dan ketergantungan pada pihak eksternal. Mulailah dengan Web Search saja, ukur dampaknya pada waktu respons, lalu tambahkan Web Scraping saat Anda butuh ekstraksi konten yang lebih dalam.


Kesalahan Umum yang Perlu Dihindari

KesalahanMengapa pentingSolusi
Membiarkan whitelist domain kosong dalam konteks bisnisAgent bisa mengutip sumber yang tidak andalTambahkan daftar kurasi berisi 2โ€“5 domain tepercaya
Mengatur Max Results di atas 5Nilai lebih tinggi menambah latensi secara nyataPertahankan di 3โ€“5 kecuali kedalaman jawaban sangat penting
Mengaktifkan Include Images tanpa filter ukuranGambar besar memperlambat ekstraksi secara signifikanAtur Max Image Size 2โ€“5 MB untuk pemakaian umum
Memakai timeout di bawah 10 detikTimeout yang terlalu cepat sering menyebabkan scraping gagalPakai 20โ€“30 detik sebagai patokan
Mengaktifkan Web Scraping untuk percakapan rahasiaUser bisa membagikan URL apa pun, termasuk halaman internalAktifkan scraping hanya jika audiens dan kontennya sesuai
Tidak menguji setelah konfigurasiSetelan mungkin tidak bekerja seperti yang diharapkan di semua situsUji dengan 3โ€“5 URL yang representatif sebelum go live

Periksa hasilnya

  1. Buka panel preview di sisi kanan CMS (atau klik Preview di top bar).
  2. Ajukan pertanyaan yang tidak bisa dijawab knowledge base Anda, misalnya tentang berita hari ini atau harga terkini. Agent seharusnya menjawab dengan informasi dari web.
  3. Tempelkan URL publik dan minta agent merangkumnya. Ini menguji Web Scraping.
  4. Jika Anda sudah puas dengan jawabannya, klik Publish agar user sungguhan mendapatkan perubahan tersebut. Lihat Preview dan Publish Perubahan.

Langkah berikutnya

  • Berikutnya dalam jalur ini: Menghubungkan API Anda, agar agent bisa membaca dan bertindak atas data di sistem Anda sendiri.
  • Menggunakan Plugin: perluas agent Anda dengan plugin siap pakai untuk operasi umum.
  • Analitik & Log: lihat bagaimana agent Anda memakai konten web dalam percakapan nyata.