Cloudflare menambahkan pengaturan baru bernama Disallow AI Training untuk pemilik situs yang ingin tetap ditemukan lewat mesin pencari, tetapi tidak ingin kontennya dipakai untuk melatih atau menyempurnakan model AI. Fitur ini diumumkan pada 15 September 2026, bersamaan dengan perubahan cara Cloudflare mengelompokkan crawler berdasarkan tujuan aksesnya.
Perubahan ini menjawab masalah yang selama ini cukup merepotkan pengelola situs: satu crawler bisa dipakai untuk lebih dari satu tujuan. Crawler yang sama dapat mengambil halaman untuk indeks pencarian sekaligus mengumpulkan data untuk pelatihan model. Jika pemilik situs memblokir crawler tersebut secara penuh, visibilitas di pencarian ikut hilang. Jika dibiarkan, akses untuk training juga ikut terbuka.
Cloudflare sekarang membedakan tiga kategori utama: Search untuk crawler yang membangun indeks, Training untuk crawler yang mengambil data guna melatih atau melakukan fine-tuning model, dan Agent untuk agen yang membuka halaman atas nama pengguna. Menurut Cloudflare, pengelompokan berdasarkan perilaku ini memungkinkan pemilik situs membuat aturan yang lebih spesifik daripada sekadar menyalakan atau mematikan semua bot AI.
## Disallow AI Training bukan blokir total
Pengaturan baru itu bekerja dengan menerbitkan preferensi no-training ke robots.txt melalui Bot Preference Sync. Crawler campuran yang dianggap accountable tetap dapat mengakses situs untuk kebutuhan pencarian, tetapi harus menghormati preferensi agar konten tidak dipakai untuk training. Crawler training-only dari Amazon, Anthropic, Meta, dan OpenAI tetap diblokir ketika aturan tersebut diterapkan, menurut penjelasan Cloudflare.
Perbedaan ini penting karena robots.txt sendiri bukan firewall. File tersebut menyampaikan preferensi kepada crawler, tetapi tidak otomatis menghentikan semua permintaan yang datang ke server. Cloudflare menggabungkan sinyal robots.txt dengan penegakan di lapisan jaringan, sehingga keputusan akses tidak hanya bergantung pada apakah sebuah bot bersedia mengikuti aturan yang dipublikasikan.
Cloudflare juga mengubah arti opsi Block. Sebelumnya, pemilik situs dapat menghindari pemblokiran crawler campuran karena tindakan itu berpotensi mematikan akses pencarian. Setelah Disallow AI Training tersedia, Block dan Block on pages with ads kini dapat berlaku pada crawler campuran. Artinya, pemilik situs yang memilih Block harus menerima konsekuensi bahwa Applebot, Bingbot, atau Googlebot yang masuk dalam kategori campuran dapat ikut kehilangan akses pencarian.
## Masalah identitas belum selesai
Kontrol yang lebih rinci membantu, tetapi tidak menghapus persoalan kepercayaan. Klasifikasi crawler tetap bergantung pada identitas, perilaku, dan informasi yang diberikan operatornya. Bot yang mengaku melakukan pencarian belum tentu dipakai hanya untuk mengirimkan pengunjung. Sebaliknya, bot yang mengakses halaman untuk fitur agen dapat memiliki kebutuhan berbeda dari crawler yang mengumpulkan korpus training dalam skala besar.
Cloudflare sebelumnya memperkenalkan Bot Preference Sync sebagai cara untuk menyelaraskan aturan dashboard dengan robots.txt. Dalam pembaruan Agustus, perusahaan juga mengatakan crawler campuran yang ingin tetap lolos ketika pemilik situs menolak training perlu memberi informasi tambahan. Syarat yang disebut mencakup menghormati preferensi no-training, menyediakan cara bagi pemilik situs untuk menolak ringkasan AI, serta memberi visibilitas tingkat URL tentang halaman yang tersedia untuk training dan metrik penggunaannya.
Bagi penerbit, ini memindahkan perdebatan dari pertanyaan sederhana—boleh atau tidak crawler AI masuk—ke pertanyaan yang lebih operasional: crawler mana yang datang, untuk tujuan apa, dan apakah ada manfaat yang kembali ke situs. Pencarian tradisional masih berpotensi mengirim klik. Training model tidak menawarkan aliran kunjungan yang sama, sementara agen AI bisa mengambil isi halaman tanpa selalu menghasilkan kunjungan yang terlihat.
## Pemilik situs tetap harus menguji aturannya
Perubahan Cloudflare tidak berarti semua situs akan otomatis berada dalam konfigurasi ideal. Pemilik domain perlu memeriksa aturan Bot Management, isi robots.txt, serta respons aktual yang diterima oleh beberapa user-agent. Konfigurasi lama seperti Block AI Bots dan Managed Robots.txt juga sedang diarahkan ke sistem baru, sehingga aturan yang terlihat di dashboard perlu dibandingkan dengan hasil pengujian di edge.
Cloudflare menyebut pelanggan lama pada umumnya akan dibawa ke konfigurasi baru tanpa tindakan manual. Namun, untuk situs yang bergantung pada pencarian, iklan, atau distribusi melalui asisten AI, “tidak perlu melakukan apa-apa” bukan berarti “tidak perlu memeriksa apa-apa”. Perbedaan kecil antara crawler Search, Training, dan Agent dapat memengaruhi indeks, ringkasan AI, beban server, serta peluang sebuah artikel ditemukan.
Langkah Cloudflare memperlihatkan arah baru infrastruktur web: izin akses tidak lagi cukup dijelaskan oleh identitas perusahaan atau nama user-agent. Pemilik situs mulai meminta batas yang lebih jelas antara menemukan, merangkum, dan melatih. Standarnya masih berkembang, tetapi setidaknya kontrol baru ini mengakui bahwa ketiganya bukan aktivitas yang sama.
Sumber utama: https://blog.cloudflare.com/accountable-mixed-use-ai-crawlers/ Sumber tambahan: https://blog.cloudflare.com/content-independence-day-ai-options/ Konteks: https://blog.cloudflare.com/bot-preference-sync/ Konteks tambahan: https://blog.cloudflare.com/agentic-internet-bot-report/
