X-Robots-Tag i AI Overviews / AI Mode – kontrola danych wejściowych

Nagłówek X-Robots-Tag może wpływać na to, czy treść zostanie wykorzystana w AI Overviews i AI Mode. Jeśli nie chcesz żeby treści były wykorzystywane w tych funkcjach, możesz ograniczyć lub zablokować ich wykorzystanie za pomocą odpowiedniej dyrektywy. Chodzi o nosnippet i max-snippet, które wprost ograniczają możliwość wykorzystania treści jako danych wejściowych do AI Overviews i AI Mode.

X Robots Tag i AI Overviews

nosnippet i max-snippet – blokada lub ograniczenie treści dla AI

Dokumentacja Google rozszerza zasięg dwóch dyrektyw, które od lat kojarzy się tylko z klasycznym SERP:

  1. nosnippet – blokuje tekstowy fragment i podgląd wideo, a dodatkowo AI Overviews i AI Mode zabraniając wykorzystania treści jako danych wejściowych
  2. max-snippet:[liczba] – analogicznie ogranicza, jak dużo treści może zostać użyte jako wejście do AI Overviews/AI Mode. Wyjątkiem jest tutaj udostępnianie dane strukturalnych (schema.org)

2 zastrzeżenia dla nosnippet

  1. Korzystając z nosnippetnie da się ustawić, żeby pokazywało fragment w normalnych wynikach wyszukiwania i jednocześnie blokować jako dane wejściowe do AI Overviews czy AI Mode. Ustawienie nosnippet wyłącza jedno i drugie jednocześnie na poziomie całej strony. Jedyny dostępny mechanizm, który mógłby w pewien sposób kontrolować, to data-nosnippet dla konkretnego fragmentu HTML, o czym więcej w tabeli na końcu artykułu
  2. Drugie zastrzeżenie dotyczy zakresu tego mechanizmu, ponieważ nosnippet jest wspierany przez Google (wyszukiwarka, AI Overviews, AI Mode) oraz Bing (wyszukiwarka, Copilot). Nie znalazłem więcej informacji ale biorąc na logikę
    • Perplexity generuje odpowiedzi bezpośrednio na bazie wyników, które wyciąga z sieci (Google/Bing). Jeśli strona używa nosnippet, to Perplexity nie umieści „tego” fragmentu bezpośrednio w odpowiedzi. To samo może dotyczyć ChatGPT Search 🙂

3 warstwy kontroli: blokada, ograniczenie, nie indeksowanie

3 niezależne „przełączniki” na 3 różnych poziomach infrastruktury. Mieszanie ich w jednym akapicie jest źródłem połowy nieporozumień w tym temacie.

  1. Crawl – robots.txt mówi czy boty w ogóle mogą dotrzeć do treści
  2. Ograniczenie – X-Robots-Tag: nosnippet/max-snippet mówi czy treść może zasilić AI Overviews i AI Mode oraz w jakiej ilości
  3. (no)index – X-Robots-Tag: noindex mówi czy treść może trafić do indeksu. Najlepiej wykorzystać na plikach obrazów lub PDF

Prawdziwy mechanizm opt-out z treningu AI

Realny, działający mechanizm kontroli treningu AI to robots.txt z ustalonym konkretnym user-agent ale to całkowicie inna warstwa niż X-Robots-Tag. Robots.txt działa na poziomie crawlowania, a nie na poziomie nagłówka.

Boty głównych dostawców identyfikują się własnymi user-agentami:

DostawcaUser-agent
OpenAI (ChatGPT)GPTBot
Anthropic (Claude)ClaudeBot
GoogleGoogle-Extended
PerplexityPerplexityBot

Zablokowanie Google-Extended nie wpływa na ranking w wyszukiwarce tylko na wykorzystanie treści do trenowania modeli Google. Wykorzystanie robots.txt do blokady crawlowania zapobiega wykorzystaniu treści w przyszłości. Nie usuwa treści, które zostały już pobrane i wykorzystane do wytrenowania istniejących, wdrożonych modeli.

Ta warstwa też nie jest gwarantowana niezależnie od kierunku czasu, w jakim działa. Cloudflare opisał w sierpniu 2025 r. niezadeklarowane crawlery Perplexity, rotujące user-agent, IP i ASN, które nie respektowały robots.txt1. Robots.txt to standard umowny i nie musi być przestrzegany.

Który przełącznik dla jakiego celu

Model 3 warstw jest użyteczny dopiero wtedy, gdy przekłada się na konkretną decyzję wdrożeniową. Poniższa tabela porządkuje to pod kątem najczęstszych celów, z jakimi ktoś w ogóle sięga po te dyrektywy.

CelWarstwaRozwiązanie
Nie chcę, żeby bot AI trenował na moich danych od terazCrawlrobots.txt
Chcę pozostać w klasycznym indeksie, ale nie chcę zasilać AI Overviews / AI ModeOgraniczenieX-Robots-Tag: nosnippet, kosztem utraty klasycznego tekstowego fragmentu w SERP
Chcę ukryć tylko fragment strony, na przykład cennik, przed wykorzystaniem przez AI, zachowując snippet dla reszty treściOgraniczenie szczegółoweatrybut data-nosnippet na konkretnym elemencie HTML, nie cała strona
Nie chcę być w indeksie Google w ogóleIndeksacjaX-Robots-Tag: noindex, co automatycznie wyklucza treść także z AI Overviews i AI Mode
Chcę kontrolować konkretny produkt AI spoza Google, na przykład Perplexity czy Bing CopilotZależnie od dostawcysprawdzenie dokumentacji danego dostawcy, nosnippet nie ma tu zastosowania
Chcę usunąć treść już wykorzystaną do wytrenowania istniejącego modeluŻadna z powyższychnie istnieje taki mechanizm; robots.txt działa wyłącznie na przyszłe crawlowanie

Ostatni wiersz tej tabeli jest może najważniejszy praktycznie i najbardziej rozczarowujacy, bo nie działa wstecz. Cała architektura kontroli dotyczy tylko i wyłącznie tego, co stanie się z treścią od momentu wdrożenia reguły.

Interaktywna macierz decyzyjna

Określ, czego chcesz zabronić lub ograniczyć. Narzędzie wskaże właściwą warstwę kontroli i możliwe rozwiązanie.
  1. Perplexity wykorzystuje ukryte, niezgłoszone roboty indeksujące, aby ominąć dyrektywę zakazującą indeksowania witryn internetowych – https://blog.cloudflare.com/perplexity-is-using-stealth-undeclared-crawlers-to-evade-website-no-crawl-directives/ (artykuł po angielsku) ↩︎

Dodaj komentarz

Twój adres email nie zostanie opublikowany. Wymagane pola są oznaczone *