X-Robots-Tag i AI Overviews / AI Mode – kontrola danych wejściowych
Nagłówek X-Robots-Tag może wpływać na to, czy treść zostanie wykorzystana w AI Overviews i AI Mode. Jeśli nie chcesz żeby treści były wykorzystywane w tych funkcjach, możesz ograniczyć lub zablokować ich wykorzystanie za pomocą odpowiedniej dyrektywy. Chodzi o nosnippet i max-snippet, które wprost ograniczają możliwość wykorzystania treści jako danych wejściowych do AI Overviews i AI Mode.

nosnippet i max-snippet – blokada lub ograniczenie treści dla AI
Dokumentacja Google rozszerza zasięg dwóch dyrektyw, które od lat kojarzy się tylko z klasycznym SERP:
nosnippet– blokuje tekstowy fragment i podgląd wideo, a dodatkowo AI Overviews i AI Mode zabraniając wykorzystania treści jako danych wejściowychmax-snippet:[liczba]– analogicznie ogranicza, jak dużo treści może zostać użyte jako wejście do AI Overviews/AI Mode. Wyjątkiem jest tutaj udostępnianie dane strukturalnych (schema.org)
2 zastrzeżenia dla nosnippet
- Korzystając z
nosnippetnie da się ustawić, żeby pokazywało fragment w normalnych wynikach wyszukiwania i jednocześnie blokować jako dane wejściowe do AI Overviews czy AI Mode. Ustawienienosnippetwyłącza jedno i drugie jednocześnie na poziomie całej strony. Jedyny dostępny mechanizm, który mógłby w pewien sposób kontrolować, todata-nosnippetdla konkretnego fragmentu HTML, o czym więcej w tabeli na końcu artykułu - Drugie zastrzeżenie dotyczy zakresu tego mechanizmu, ponieważ
nosnippetjest wspierany przez Google (wyszukiwarka, AI Overviews, AI Mode) oraz Bing (wyszukiwarka, Copilot). Nie znalazłem więcej informacji ale biorąc na logikę- Perplexity generuje odpowiedzi bezpośrednio na bazie wyników, które wyciąga z sieci (Google/Bing). Jeśli strona używa nosnippet, to Perplexity nie umieści „tego” fragmentu bezpośrednio w odpowiedzi. To samo może dotyczyć ChatGPT Search 🙂
3 warstwy kontroli: blokada, ograniczenie, nie indeksowanie
3 niezależne „przełączniki” na 3 różnych poziomach infrastruktury. Mieszanie ich w jednym akapicie jest źródłem połowy nieporozumień w tym temacie.
- Crawl – robots.txt mówi czy boty w ogóle mogą dotrzeć do treści
- Ograniczenie – X-Robots-Tag:
nosnippet/max-snippetmówi czy treść może zasilić AI Overviews i AI Mode oraz w jakiej ilości - (no)index – X-Robots-Tag:
noindexmówi czy treść może trafić do indeksu. Najlepiej wykorzystać na plikach obrazów lub PDF
Prawdziwy mechanizm opt-out z treningu AI
Realny, działający mechanizm kontroli treningu AI to robots.txt z ustalonym konkretnym user-agent ale to całkowicie inna warstwa niż X-Robots-Tag. Robots.txt działa na poziomie crawlowania, a nie na poziomie nagłówka.
Boty głównych dostawców identyfikują się własnymi user-agentami:
| Dostawca | User-agent |
|---|---|
| OpenAI (ChatGPT) | GPTBot |
| Anthropic (Claude) | ClaudeBot |
| Google-Extended | |
| Perplexity | PerplexityBot |
Zablokowanie Google-Extended nie wpływa na ranking w wyszukiwarce tylko na wykorzystanie treści do trenowania modeli Google. Wykorzystanie robots.txt do blokady crawlowania zapobiega wykorzystaniu treści w przyszłości. Nie usuwa treści, które zostały już pobrane i wykorzystane do wytrenowania istniejących, wdrożonych modeli.
Ta warstwa też nie jest gwarantowana niezależnie od kierunku czasu, w jakim działa. Cloudflare opisał w sierpniu 2025 r. niezadeklarowane crawlery Perplexity, rotujące user-agent, IP i ASN, które nie respektowały robots.txt1. Robots.txt to standard umowny i nie musi być przestrzegany.
Który przełącznik dla jakiego celu
Model 3 warstw jest użyteczny dopiero wtedy, gdy przekłada się na konkretną decyzję wdrożeniową. Poniższa tabela porządkuje to pod kątem najczęstszych celów, z jakimi ktoś w ogóle sięga po te dyrektywy.
| Cel | Warstwa | Rozwiązanie |
|---|---|---|
| Nie chcę, żeby bot AI trenował na moich danych od teraz | Crawl | robots.txt |
| Chcę pozostać w klasycznym indeksie, ale nie chcę zasilać AI Overviews / AI Mode | Ograniczenie | X-Robots-Tag: nosnippet, kosztem utraty klasycznego tekstowego fragmentu w SERP |
| Chcę ukryć tylko fragment strony, na przykład cennik, przed wykorzystaniem przez AI, zachowując snippet dla reszty treści | Ograniczenie szczegółowe | atrybut data-nosnippet na konkretnym elemencie HTML, nie cała strona |
| Nie chcę być w indeksie Google w ogóle | Indeksacja | X-Robots-Tag: noindex, co automatycznie wyklucza treść także z AI Overviews i AI Mode |
| Chcę kontrolować konkretny produkt AI spoza Google, na przykład Perplexity czy Bing Copilot | Zależnie od dostawcy | sprawdzenie dokumentacji danego dostawcy, nosnippet nie ma tu zastosowania |
| Chcę usunąć treść już wykorzystaną do wytrenowania istniejącego modelu | Żadna z powyższych | nie istnieje taki mechanizm; robots.txt działa wyłącznie na przyszłe crawlowanie |
Ostatni wiersz tej tabeli jest może najważniejszy praktycznie i najbardziej rozczarowujacy, bo nie działa wstecz. Cała architektura kontroli dotyczy tylko i wyłącznie tego, co stanie się z treścią od momentu wdrożenia reguły.
Interaktywna macierz decyzyjna
- Perplexity wykorzystuje ukryte, niezgłoszone roboty indeksujące, aby ominąć dyrektywę zakazującą indeksowania witryn internetowych – https://blog.cloudflare.com/perplexity-is-using-stealth-undeclared-crawlers-to-evade-website-no-crawl-directives/ (artykuł po angielsku) ↩︎
