robots.txt, web crawler’lara bir sitedeki hangi URL yollarına erişip erişemeyeceklerini bildiren teknik yönerge dosyasıdır. Yapay zekâ sistemleriyle ilişkili crawler’ların sayısı arttıkça bu dosya, markaların içerik erişim politikalarını yönetmesinde daha önemli bir rol üstlenmiştir.
Ancak tüm AI botları aynı amaçla çalışmaz. Bazıları model geliştirme süreçleriyle, bazıları güncel web aramasıyla, bazıları ise kullanıcı tarafından başlatılan sayfa erişimiyle ilişkilendirilebilir. Bu nedenle tüm botlara aynı kuralı uygulamak yerine user-agent bazlı ve içerik türüne göre ayrıştırılmış bir politika oluşturmak daha doğru olur.
Bu yazıda AI botlarının robots.txt ile nasıl yönetilebileceğini, izin ve engelleme kurallarının nasıl oluşturulduğunu, hangi içeriklerin açık veya kapalı tutulabileceğini, erişim politikasının nasıl planlanacağını ve değişikliklerin sunucu loglarıyla nasıl izlenebileceğini ele alacağız.
robots.txt Nedir?
robots.txt, web sitesinin kök dizininde yayımlanan düz metin dosyasıdır. Genellikle şu adreste bulunur:
https://www.orneksite.com/robots.txt
Dosyada crawler’lar için user-agent tanımları ve bu botlara uygulanacak erişim kuralları yer alır.
Temel yapı şöyledir:
User-agent: BotAdi
Disallow: /engellenecek-dizin/
- User-agent, kuralın hangi crawler için geçerli olduğunu belirtir.
- Disallow, erişimin sınırlandırılacağı URL yolunu tanımlar.
- Allow, daha geniş bir engelin içinde açık bırakılacak belirli yolları gösterebilir.
robots.txt, crawler’lara yönelik bir bildirim dosyasıdır. Gizli veya hassas içerikleri güvenli hâle getiren bir erişim kontrol sistemi değildir.
AI Botları Neden Ayrı Yönetilmelidir?
AI botlarının amaçları ve erişim biçimleri farklı olabilir. Bu nedenle her botun işlevi ayrı değerlendirilmelidir.
Başlıca bot grupları şunlardır:
Model Geliştirme Botları
Bu botlar, yapay zekâ modellerinin geliştirilmesi veya iyileştirilmesi kapsamında kullanılabilecek kamuya açık içeriklere erişebilir.
Arama ve Retrieval Botları
Kullanıcı sorgusu sırasında güncel web kaynaklarını bulmak ve yanıtı destekleyecek içerikleri getirmek için kullanılabilir.
Kullanıcı Tarafından Tetiklenen Botlar
Kullanıcının belirli bir URL’yi açması, analiz ettirmesi veya özetletmesi sonucunda sayfaya erişebilir.
Arama Motoru Crawler’ları
Googlebot ve Bingbot gibi klasik crawler’lar arama dizinlerini oluşturur. Bazı üretken yapay zekâ deneyimleri bu dizinlerden yararlanabildiği için arama motoru botlarının erişimi de dolaylı olarak AI görünürlüğünü etkileyebilir.
Bu ayrım, model geliştirme erişimi ile güncel arama erişiminin aynı süreç olmadığını gösterir.
Belirli Bir AI Botuna Nasıl İzin Verilir?
Bir AI botu için engellenmiş yol bulunmadığını belirtmenin en temiz ve yaygın yolu, Disallow alanını boş bırakmaktır:
User-agent: OrnekAIBot
Disallow:
Bu yapı, ilgili user-agent için özel bir erişim engeli bulunmadığını ifade eder.
Yalnızca Allow: / satırını kullanmak bazı crawler veya robots.txt ayrıştırıcılarında standart dışı yorumlanabilir. Engelleme olmadığında boş Disallow satırı daha uyumlu bir yaklaşımdır.
Belirli Bir AI Botu Nasıl Engellenir?
Bir botun tüm siteye erişimini engellemek için şu yapı kullanılabilir:
User-agent: OrnekAIBot
Disallow: /
Bot adı mutlaka doğru yazılmalıdır. Yanlış veya geçersiz bir user-agent tanımı beklenen sonucu vermez.
Tüm crawler’ları engelleyen şu genel kural ise dikkatle kullanılmalıdır:
User-agent: *
Disallow: /
Bu kural yalnızca AI botlarını değil, robots.txt yönergelerine uyan arama motoru crawler’larını da engelleyebilir. Sonuç olarak sitenin arama motorlarında keşfedilmesi ve güncellenmesi sınırlanabilir.
Belirli Klasör ve Parametreler Nasıl Yönetilir?
AI botlarının yalnızca belirli dizinlere erişmesi sınırlandırılabilir:
User-agent: OrnekAIBot
Disallow: /uyelik/
Disallow: /hesabim/
Disallow: /dahili-arama/
Disallow: /test/
Bu yaklaşım, kamuya açık blog ve kurumsal içerikleri erişime açık bırakırken özel veya düşük değerli alanları sınırlandırabilir.
Filtreleme, sıralama ve dahili arama URL’leri için parametre bazlı kurallar da kullanılabilir:
User-agent: OrnekAIBot
Disallow: /arama/
Disallow: /*?sort=
Disallow: /*?filter=
Ancak wildcard ve parametre desteği tüm crawler’larda aynı olmayabilir. Bu nedenle botun güncel dokümantasyonu kontrol edilmeli ve kurallar yayına alınmadan önce test edilmelidir.
Genel Engel İçinde Belirli Bir Yol Nasıl Açılır?
Site genelinde erişim sınırlandırılıp belirli bir klasör açık bırakılabilir:
User-agent: OrnekAIBot
Disallow: /
Allow: /blog/
Bu tür kuralların yorumlanması crawler’a göre değişebileceği için mümkün olduğunda sade yapılar tercih edilmelidir. Allow desteği ve kural önceliği, ilgili botun resmî dokümantasyonundan doğrulanmalıdır.
Birden Fazla AI Botu Nasıl Yönetilir?
Her bot için ayrı user-agent grubu oluşturulabilir:
User-agent: BirinciAIBot
Disallow: /
User-agent: IkinciAIBot
Disallow: /ozel-icerik/
User-agent: UcuncuAIBot
Disallow:
Bu yapı sayesinde:
- Bir model geliştirme botu tamamen engellenebilir.
- Bir arama botuna kamuya açık içerikler için izin verilebilir.
- Belirli bir bota yalnızca dokümantasyon alanı açılabilir.
- Arama motoru crawler’larının erişimi korunabilir.
Politika yalnızca bot adına göre değil, botun amacı ve markanın içerik stratejisi dikkate alınarak oluşturulmalıdır.
Hangi Sayfalar Açık veya Kapalı Tutulmalı?
Her web sitesi için geçerli tek bir doğru erişim politikası yoktur. Karar, içerik türüne ve markanın hedeflerine göre verilmelidir.
Açık Bırakılması Değerlendirilebilecek Sayfalar
- Blog yazıları
- Pillar içerikler
- Rehberler
- Kurumsal sayfalar
- Ürün ve hizmet açıklamaları
- Kamuya açık dokümantasyon
- Sık sorulan sorular
- Vaka analizleri
- Özgün araştırmalar
- Basın ve marka sayfaları
- Güvenlik ve uyumluluk açıklamaları
Bu içerikler markanın uzmanlığını, ürünlerini ve hizmetlerini doğru biçimde anlatıyorsa erişime açık tutulmaları değerlendirilebilir.
Kapatılması Değerlendirilebilecek Sayfalar
- Kullanıcı hesapları
- Üyelik gerektiren alanlar
- Yönetim panelleri
- Sepet ve ödeme sayfaları
- Test ve staging ortamları
- Dahili arama sonuçları
- Filtre ve sıralama URL’leri
- Geçici kampanya sayfaları
- Kopya veya düşük değerli sayfalar
- Lisanslı ve ücretli içerikler
- Kişisel ya da hassas veri içeren alanlar
Gizli, kişisel veya ücretli içerikler yalnızca robots.txt ile korunmamalıdır. Bu alanlarda kimlik doğrulama, yetkilendirme ve sunucu düzeyinde erişim kontrolleri kullanılmalıdır.
AI Botlarını Engellemek GEO Görünürlüğünü Etkiler mi?
Bir AI botunu engellemek, ilgili user-agent’ın siteyi doğrudan taramasını sınırlayabilir. Ancak bunun AI görünürlüğüne etkisi, platformun bilgiye nasıl ulaştığına göre değişir.
Bir yapay zekâ sistemi marka hakkındaki bilgileri:
- Arama motoru dizinlerinden
- Daha önce edinilmiş içeriklerden
- Üçüncü taraf yayınlardan
- Resmî veri kaynaklarından
- İş ortaklarının sitelerinden
- Kullanıcının sağladığı URL’lerden edinebilir.
Bu nedenle bir botu engellemek markayı tüm AI yanıtlarından kaldırmaz. Benzer biçimde erişime izin vermek de kaynak gösterimi, önerilme veya belirli promptlarda görünürlük garantisi sunmaz.
Bot erişimi, GEO stratejisinin yalnızca teknik katmanlarından biridir.
AI Bot Erişim Politikası Nasıl Oluşturulur?
Erişim politikası oluşturulurken botlar, içerik türleri ve iş hedefleri birlikte değerlendirilmelidir.
Bot Envanteri Oluşturun
Öncelikle siteye erişen botları belirleyin.
Her bot için şu bilgileri kaydedin:
- User-agent adı
- İlişkili platform
- Temel amacı
- Resmî dokümantasyon adresi
- robots.txt desteği
- Kimlik doğrulama yöntemi
- Siteye erişim sıklığı
İçerikleri Sınıflandırın
İçerikleri aşağıdaki gruplara ayırabilirsiniz:
- Kamuya açık ve görünürlük odaklı içerikler
- Ticari değeri yüksek içerikler
- Lisanslı veya ücretli içerikler
- Kişisel ya da özel alanlar
- Düşük değerli teknik URL’ler
- Filtre, arama ve test sayfaları
İş Hedeflerini Belirleyin
Markanın önceliği AI sistemlerinde görünürlük kazanmak, içerik kullanımını sınırlandırmak veya iki hedef arasında denge kurmak olabilir. Bu tercih, hangi botların hangi alanlara erişebileceğini doğrudan etkiler.
Riskleri Değerlendirin
Karar sürecinde şu konular dikkate alınmalıdır:
- Fikrî mülkiyet yaklaşımı
- İçerik lisanslama şartları
- Kişisel veri ve güvenlik riskleri
- Sunucu kaynakları
- Bot trafiğinin maliyeti
- GEO hedefleri
- İçeriklerin kamuya açıklık düzeyi
Erişim politikası içerik, teknik, hukuk, güvenlik ve pazarlama ekiplerinin katılımıyla oluşturulmalıdır.
AI Botları Sunucu Loglarında Nasıl İzlenir?
Sunucu logları, botların hangi URL’lere eriştiğini ve hangi yanıtlarla karşılaştığını gösterir.
Loglarda şu alanlar incelenebilir:
- User-agent
- Talep edilen URL
- IP adresi
- HTTP durum kodu
- Erişim zamanı
- Yanıt süresi
- Aktarılan veri miktarı
- Yönlendirme bilgileri
Log analiziyle şu sorulara yanıt aranabilir:
- Hangi AI botları siteye erişiyor?
- Hangi URL grupları taranıyor?
- Stratejik sayfalara erişim gerçekleşiyor mu?
- Gereksiz parametre URL’leri ziyaret ediliyor mu?
- 403, 429 veya 5xx yanıtları oluşuyor mu?
- Bot trafiği sunucu performansını etkiliyor mu?
- Engellenmesi gereken alanlara erişim denemesi var mı?
User-agent bilgisi tek başına bot kimliğini doğrulamak için yeterli değildir. Kötü niyetli sistemler başka botların user-agent bilgisini taklit edebilir.
Gerekli durumlarda IP doğrulaması, ters DNS kontrolü ve ilgili platformun resmî bot dokümantasyonu kullanılmalıdır.
robots.txt Değişiklikleri Nasıl Test Edilir?
robots.txt dosyasında yapılan değişiklikler hem yayın öncesinde hem de yayın sonrasında kontrol edilmelidir.
Test sürecinde:
- Dosyanın kök dizinde bulunduğunu doğrulayın.
- User-agent adlarının doğru yazıldığını kontrol edin.
- Kurallar arasında çelişki bulunmadığından emin olun.
- Önemli sayfaların yanlışlıkla engellenmediğini doğrulayın.
- Allow ve Disallow önceliklerini test edin.
- Wildcard ve parametre kurallarını kontrol edin.
- CDN veya cache nedeniyle eski dosyanın sunulmadığından emin olun.
- Yayın sonrasında bot trafiğini loglardan takip edin.
- 403, 429 ve 5xx yanıtlarındaki değişimleri değerlendirin.
robots.txt değişiklikleri crawler davranışına hemen yansımayabilir. Botun dosyayı yeniden kontrol etmesi ve siteyi tekrar ziyaret etmesi gerekebilir.
robots.txt AI Bot Yönetimi İçin Yeterli mi?
robots.txt, bot erişim politikasının temel parçalarından biridir ancak tek başına yeterli değildir.
Kapsamlı bir yönetim modeli şu katmanları içerebilir:
- robots.txt kuralları
- CDN politikaları
- Güvenlik duvarı ayarları
- Sunucu düzeyinde erişim kontrolleri
- Kimlik doğrulama
- Yetkilendirme
- Rate limiting
- Sunucu log analizi
- İçerik lisanslama politikaları
- Hukuki ve kurumsal veri politikaları
robots.txt erişim niyetini bildirir. Teknik olarak zorunlu bir kısıtlama veya güvenlik kontrolü gerekiyorsa diğer katmanlar da kullanılmalıdır.
robots.txt ile AI Bot Yönetiminde Sık Yapılan Hatalar
AI botları yönetilirken şu hatalar yapılabilir:
- Tüm AI botlarını aynı amaçla çalışan sistemler olarak görmek
- User-agent adlarını yanlış yazmak
- Genel User-agent: * kuralıyla arama motorlarını yanlışlıkla engellemek
- robots.txt dosyasını güvenlik mekanizması olarak kullanmak
- Allow ve Disallow kurallarını test etmemek
- Parametreli URL’leri kontrolsüz bırakmak
- Bot kimliğini yalnızca user-agent üzerinden doğrulamak
- Değişikliklerden sonra sunucu loglarını takip etmemek
- Bot erişimini AI görünürlüğü garantisi olarak değerlendirmek
- Arama botları ile model geliştirme botlarını aynı politikayla yönetmek
- Resmî bot dokümantasyonlarını kontrol etmeden kural oluşturmak
Bu hatalar gereksiz görünürlük kaybına, sunucu yükünün artmasına veya özel alanların yanlış biçimde erişilebilir kalmasına yol açabilir.
AI Bot Erişim Politikanızı Stratejik Olarak Yönetin
robots.txt ile AI bot yönetimi, tüm crawler’ları tek seferde açmak veya kapatmak anlamına gelmez. Botların amaçları, içerik türleri, görünürlük hedefleri ve kurumsal veri politikaları birlikte değerlendirilmelidir.
Kamuya açık ve stratejik içerikler erişime açık tutulabilirken özel, lisanslı veya düşük değerli alanlar sınırlandırılabilir. Her kural yayın öncesinde test edilmeli ve yayın sonrasında sunucu loglarıyla izlenmelidir.
Boosmart olarak AI bot erişim audit hizmetimiz kapsamında robots.txt kurallarınızı, sitenize erişen AI crawler’ları, sunucu loglarınızı ve içerik erişim politikanızı birlikte değerlendiriyoruz. Elde ettiğimiz bulgular doğrultusunda teknik riskleri, içerik haklarını ve GEO hedeflerini dengeleyen, uygulanabilir bir bot yönetimi planı oluşturuyoruz.