Ne kontrol eder
Yapay zekâ şirketleri web'e farklı amaçlarla, farklı kullanıcı aracısı (user-agent) adlarıyla gelir. Kimisi model eğitimi için içerik toplar, kimisi arama sonuçları için dizin oluşturur, kimisi de bir kullanıcının sohbet içinde istediği sayfayı o anda getirir. Araç iki dosyaya bakar:
1. /robots.txt: Aşağıdaki tarayıcıların her biri için sitenizin genelinde izin verilip verilmediğini gösterir:
| Belirteç | Sağlayıcı | Kısaca amacı (sağlayıcı belgelerine göre) |
|---|
| GPTBot | OpenAI | Üretken modellerin eğitiminde kullanılabilecek içeriği tarar |
| OAI-SearchBot | OpenAI | ChatGPT'nin arama özelliklerinde siteleri göstermek için |
| ChatGPT-User | OpenAI | Kullanıcı ChatGPT'de bir şey istediğinde sayfayı ziyaret eder |
| ClaudeBot | Anthropic | Model eğitimine katkı sağlayabilecek içeriği toplar |
| anthropic-ai | Anthropic | Anthropic'in güncel belgesinde yer almayan, ancak birçok robots.txt dosyasında hâlâ görülen belirteç |
| PerplexityBot | Perplexity | Perplexity arama sonuçlarında siteleri göstermek için |
| Google-Extended | Google | İçeriğin Gemini eğitimi ve yanıt dayandırmada kullanımını yönetir; Google Arama'yı etkilemez |
| Applebot-Extended, CCBot, Bytespider ve diğerleri | Çeşitli | Robots.txt'de sık karşılaşılan diğer yapay zekâ ile ilişkili belirteçler |
2. /llms.txt: Dosya var mı ve llmstxt.org önerisindeki temel biçime uyuyor mu? Öneriye göre dosya Markdown'dır; tek zorunlu bölüm sitenin ya da projenin adını içeren bir H1 başlığıdır. Ardından kısa bir özet içeren alıntı bloğu, isteğe bağlı açıklama paragrafları ve link listeleri içeren H2 bölümleri gelir.
Dosyanız yoksa araç, sitenizin başlığı ve önemli sayfalarıyla başlayabileceğiniz örnek bir llms.txt oluşturabilir.
Nasıl kullanılır
- Alan adınızı girin (örneğin
ornek.com).
- Tablo her tarayıcı için "izinli", "engelli" veya "kısmen engelli" durumunu gösterir. Kısmen engelli, bazı dizinlerin kapalı olduğu anlamına gelir.
- llms.txt bölümünde dosyanın bulunup bulunmadığını ve biçim kontrollerini okuyun.
- İsterseniz örnek llms.txt'yi kopyalayıp düzenleyin ve sitenizin kök dizinine yükleyin.
Sonuçları nasıl yorumlamalı
Eğitim ile arama ayrı kararlardır. OpenAI'nin tarayıcı belgesi, GPTBot'u engelleyip OAI-SearchBot'a izin vererek içeriğin eğitimde kullanılmamasını ama ChatGPT aramasında görünmesini sağlayabileceğinizi anlatır. Anthropic de kendi belgesinde ClaudeBot, Claude-User ve Claude-SearchBot için ayrı belirteçler tanımlar. Hepsini tek satırla engellemek, istemediğiniz bir görünürlük kaybına yol açabilir.
Kullanıcı kaynaklı ziyaretler farklı işler. OpenAI, ChatGPT-User için robots.txt kurallarının uygulanmayabileceğini; Perplexity de belgesinde Perplexity-User'ın genellikle robots.txt'yi dikkate almadığını belirtir, çünkü bu istekleri bir kullanıcı başlatır.
Google-Extended arama sıranızı değiştirmez. Google'ın tarayıcı listesine göre bu belirteç yalnızca bir kontrol işaretidir; ayrı bir tarayıcı olarak siteyi ziyaret etmez ve Google Arama'ya dahil olmayı etkilemez.
Yanlışlıkla engellenmiş Googlebot'a dikkat. Yapay zekâ botlarını engellemek için yazılan geniş kurallar bazen User-agent: * altında tüm tarayıcıları kapatır. Rapordaki genel kuralları da kontrol edin.
Sınırlamalar
- Araç robots.txt kurallarını okur; botların bu kurallara gerçekten uyup uymadığını doğrulayamaz. Sunucu kayıtlarınız bunun için daha güvenilir kaynaktır.
- Sağlayıcılar belirteç adlarını ve amaçlarını zaman zaman günceller; kararınızı her zaman sağlayıcının güncel belgesine göre verin.
- llms.txt kontrolü temel biçime bakar; içeriğin doğruluğunu veya hangi hizmetlerin dosyayı okuduğunu değerlendirmez.
- Yapay zekâ yanıtlarındaki görünürlüğünüzü ölçmez. Bu ölçüm yapay zekâ görünürlük takibi sayfasında anlatılan, hazırlık aşamasındaki özelliğin konusudur.