Wstęp
Boty AI, takie jak ChatGPT, Copilot, Perplexity czy Google AI (np. Gemini), coraz częściej odwiedzają strony internetowe, aby pobierać treści do wyszukiwania i odpowiedzi generowanych przez sztuczną inteligencję. Jeśli przypadkowo je blokujesz, Twoje treści mogą nie być wykorzystywane przez nowe usługi AI.
Szybkie sprawdzenie
- Sprawdź plik robots.txt
- Zweryfikuj nagłówki X-Robots-Tag
- Przetestuj odpowiedź serwera dla botów AI
- Upewnij się, że firewall nie blokuje crawlerów
Krok 1: Sprawdź plik robots.txt
Otwórz adres:
https://twojadomena.pl/robots.txt
Poszukaj wpisów blokujących boty AI, np.:
User-agent: GPTBot
User-agent: Google-Extended
User-agent: ClaudeBot
User-agent: PerplexityBot
Disallow: /
Podobne reguły mogą dotyczyć również m.in. ClaudeBot, Google-Extended, PerplexityBot czy Bytespider.
Krok 2: Sprawdź nagłówki HTTP
Niektóre serwery blokują indeksowanie za pomocą nagłówków HTTP, np.:
X-Robots-Tag: noindex
lub reguł dodanych przez CDN, serwer WWW albo wtyczki bezpieczeństwa.
Krok 3: Zweryfikuj odpowiedź serwera
Jeśli bot AI otrzymuje kod 403 lub 401, nie będzie mógł odczytać strony.
Możesz to sprawdzić za pomocą narzędzi online lub polecenia:
curl -I https://twojadomena.pl
Zwróć uwagę, czy serwer odpowiada kodem 200 OK.
Aby sprawdzić, czy serwer nie blokuje GPTBota, użyj:
curl -I -A "GPTBot" https://twojadomena.pl
Jeżeli otrzymasz kod 403 Forbidden, a zwykłe curl -I zwraca 200 OK, oznacza to, że blokada dotyczy konkretnego bota AI.
Krok 4: Sprawdź Cloudflare i firewall
Cloudflare, ModSecurity lub inne zapory mogą automatycznie blokować niektóre boty AI. Warto sprawdzić reguły WAF oraz logi zapory, aby upewnić się, że crawlerzy nie są odrzucani.
Jeśli korzystasz z Cloudflare, sprawdź, czy nie masz włączonej opcji blokowania AI crawlerów. Jedno kliknięcie może uniemożliwić dostęp m.in. GPTBotowi, ClaudeBotowi czy PerplexityBotowi.
Najpopularniejsze boty AI i skutki ich zablokowania
| User-Agent | Narzędzie | Efekt blokady |
|---|---|---|
| GPTBot | ChatGPT / OpenAI | OpenAI nie będzie mogło wykorzystywać treści zgodnie z rolą tego crawlera. |
| Google-Extended | Gemini | Treści nie będą wykorzystywane przez modele AI Google, ale indeksowanie w Google pozostanie bez zmian. |
| ClaudeBot | Claude | Anthropic nie będzie pobierał treści zgodnie z zasadami tego bota. |
| PerplexityBot | Perplexity | Perplexity może nie wykorzystywać strony do generowania odpowiedzi i cytowań. |
Najczęstsze przyczyny blokowania botów AI
- reguły w robots.txt
- blokady w Cloudflare lub WAF
- nagłówki X-Robots-Tag
- wtyczki bezpieczeństwa WordPress
- ręczne blokowanie adresów IP crawlerów
FAQ
Czy ChatGPT korzysta z robots.txt?
Tak. GPTBot respektuje plik robots.txt i stosuje się do znajdujących się w nim reguł.
Czy Google AI używa tych samych zasad co wyszukiwarka?
Nie zawsze. Google udostępnia osobny identyfikator Google-Extended, który pozwala kontrolować wykorzystanie treści przez modele AI bez wpływu na indeksowanie w wyszukiwarce.
Czy zablokowanie botów AI wpływa na pozycje w Google?
Samo zablokowanie botów AI nie powoduje spadku pozycji w klasycznych wynikach wyszukiwania, o ile Googlebot nadal ma dostęp do strony.
Czy Gemini ma własnego bota?
Nie. Gemini korzysta z infrastruktury Google. Jeśli chcesz kontrolować wykorzystanie treści przez modele AI Google, sprawdź ustawienia dotyczące Google-Extended oraz upewnij się, że Googlebot nie jest blokowany.
Podsumowanie
Jeśli zależy Ci na obecności treści w narzędziach opartych o sztuczną inteligencję, warto regularnie sprawdzać robots.txt, nagłówki HTTP oraz konfigurację firewalla. W wielu przypadkach przypadkowa blokada botów AI wynika z ustawień bezpieczeństwa, a jej usunięcie zajmuje zaledwie kilka minut.
Komentarze
Masz ten sam problem lub inne rozwiązanie?
Dyskutuj o tym artykule i podziel się swoim doświadczeniem:
Przejdź do zewnętrznej dyskusji na Facebooku dla tego artykułu
Ten problem nadal występuje? Napisz w komentarzu, spróbuję pomóc.