Crawler AI: OAI-SearchBot, GPTBot e gli altri

I crawler AI fanno tre lavori diversi. I crawler di ricerca come OAI-SearchBot, Claude-SearchBot e PerplexityBot indicizzano le tue pagine perché gli assistenti possano proporle. I fetcher su richiesta come ChatGPT-User, Claude-User e Perplexity-User aprono una pagina sola perché qualcuno l'ha chiesta. I crawler di addestramento come GPTBot e ClaudeBot raccolgono testo per addestrare i modelli. Bloccare quello sbagliato ti cancella dalle risposte AI.

Quasi tutti i robots.txt italiani sono stati scritti quando nessuno di questi bot esisteva. È il motivo per cui un sito risulta invisibile a un assistente e completamente aperto a un altro, senza che nessuno l'abbia deciso. Questa pagina è il riferimento: chi è ogni bot, cosa dice di fare la sua documentazione e cosa succede davvero quando lo vieti. Per la strategia a cui servono queste scelte, parti da Cos'è la GEO: guida pratica.

Punti chiave

  • Crawler di ricerca, fetcher su richiesta e crawler di addestramento sono tre decisioni separate, anche quando i bot appartengono allo stesso fornitore.
  • Un Disallow: / generico sotto User-agent: * blocca proprio i crawler di ricerca che decidono se comparire nelle risposte AI.
  • Bloccare i crawler di addestramento (GPTBot, ClaudeBot, il token Google-Extended) è una scelta di licenza sui contenuti e non ti toglie dai risultati della ricerca AI.
  • Il nome di un bot si falsifica in un minuto, quindi il traffico va verificato sugli elenchi di indirizzi IP che ogni fornitore pubblica.

Quali sono i tre tipi di crawler AI?

L'etichetta "crawler AI" tiene insieme tre attività con conseguenze diverse per la tua azienda.

  1. Crawler di ricerca. Costruiscono l'indice che l'assistente interroga quando gli serve un'informazione aggiornata. Se li blocchi, non sei nemmeno in gara per le risposte di quell'assistente.
  2. Fetcher su richiesta. Aprono un solo URL, in tempo reale, perché una persona ha chiesto qualcosa che riguarda quella pagina. Nessun indice, nessuna pianificazione.
  3. Crawler di addestramento. Raccolgono testo che potrà addestrare i modelli futuri, con effetti che si vedono nel passaggio da una generazione di modelli alla successiva, non la settimana dopo.

Tutti e tre stanno nello stesso robots.txt e sembrano intercambiabili. Non lo sono.

Chi fa cosa, token per token

Ogni riga qui sotto viene dalla documentazione del fornitore.

Token Fornitore Lavoro dichiarato Cosa dice la documentazione sul robots.txt
OAI-SearchBot OpenAI Alimenta le funzioni di ricerca di ChatGPT Va ammesso: i siti esclusi non vengono mostrati nelle risposte di ChatGPT search
GPTBot OpenAI Raccoglie contenuti per addestrare i modelli generativi Vietarlo segnala che i tuoi contenuti non vanno usati per l'addestramento
ChatGPT-User OpenAI Gestisce le azioni avviate dall'utente in ChatGPT Le regole del robots.txt possono non applicarsi, perché l'azione parte da una persona
OAI-AdsBot OpenAI Verifica la sicurezza delle pagine inviate come annunci su ChatGPT Nessuna indicazione dedicata: visita solo le pagine inviate come annunci
Claude-SearchBot Anthropic Naviga il web per migliorare la qualità dei risultati di ricerca in Claude Rispetta le direttive standard del robots.txt
ClaudeBot Anthropic Raccoglie contenuti che possono contribuire all'addestramento dei modelli Rispetta il robots.txt e l'estensione non standard Crawl-delay
Claude-User Anthropic Visita i siti quando una persona fa una domanda a Claude Rispetta le direttive del robots.txt
PerplexityBot Perplexity Mostra e linka i siti nei risultati di Perplexity Va ammesso; non raccoglie contenuti per i modelli di base
Perplexity-User Perplexity Apre una pagina per rispondere a un utente e citarla con un link In genere ignora le regole del robots.txt
Googlebot Google Costruisce gli indici della Ricerca Google Valgono le regole standard del robots.txt
Google-Extended Google Token del robots.txt per addestramento e grounding di Gemini Token di controllo senza user agent proprio

Crawler di ricerca: quelli che decidono la tua visibilità

Questi vanno trattati come tratti Googlebot.

  • OAI-SearchBot è il token che porta un sito nei risultati di ricerca di ChatGPT, e OpenAI scrive che i siti esclusi non vengono mostrati nelle risposte di ChatGPT search, pur potendo comparire come link di navigazione (OpenAI). È un token distinto da GPTBot: puoi rifiutare l'addestramento e restare cercabile.
  • Claude-SearchBot naviga il web per migliorare pertinenza e accuratezza delle risposte di ricerca in Claude, e Anthropic documenta che i suoi bot rispettano le direttive standard del robots.txt (Anthropic).
  • PerplexityBot serve a mostrare e linkare i siti nei risultati di Perplexity, e la documentazione precisa che non viene usato per raccogliere contenuti destinati ai modelli di base (Perplexity).
  • Googlebot e Google-Extended sono il caso Gemini, e funzionano in modo diverso dagli altri. Googlebot costruisce l'indice della Ricerca. Google-Extended non è un crawler: non ha uno user agent proprio, la scansione avviene con gli user agent Google esistenti e il token serve solo come comando, per gestire se i contenuti già scansionati possano addestrare i modelli Gemini futuri o essere usati per il grounding, cioè serviti al modello al momento della domanda. Google è esplicito: Google-Extended non incide sull'inclusione nella Ricerca Google e non è un fattore di ranking (Google Search Central).

Se questi crawler non raggiungono il tuo sito, tutto il resto del lavoro sulla visibilità AI non ha su cosa agire. È la prima cosa da escludere quando un assistente non ti nomina mai, come spieghiamo in Come scoprire se ChatGPT cita il tuo brand.

Fetcher su richiesta: ChatGPT-User, Claude-User, Perplexity-User

Quando una persona chiede a un assistente di guardare una pagina precisa, ci va un agente diverso. OpenAI documenta ChatGPT-User per le azioni avviate dall'utente in ChatGPT e precisa che non serve a scansionare il web in modo automatico, Anthropic documenta Claude-User per i siti visitati mentre risponde a una persona, Perplexity documenta Perplexity-User per aprire una pagina e restituire una risposta accurata con il link.

Da qui seguono due cose pratiche. La prima è che il robots.txt qui è uno strumento più debole: OpenAI scrive che le sue regole possono non applicarsi a ChatGPT-User, Perplexity scrive che Perplexity-User in genere le ignora, mentre Anthropic dichiara che i suoi agenti le rispettano. La seconda è che questo traffico non è un problema di crawl budget ma un segnale di domanda: un accesso vuol dire che una persona vera ha mandato un assistente sulla tua pagina.

Crawler di addestramento: GPTBot, ClaudeBot e il token Google-Extended

GPTBot raccoglie contenuti per addestrare i modelli generativi di base, ClaudeBot raccoglie contenuti web che possono contribuire all'addestramento dei modelli di Anthropic, Google-Extended governa l'addestramento dei modelli Gemini futuri. Perplexity non documenta nessun crawler di addestramento e dichiara che nessuno dei suoi agenti raccoglie contenuti per i modelli di base.

La decisione, qui, è di licenza prima che di SEO. Bloccare non ti costa visibilità nella ricerca AI, perché i token di ricerca sono separati, ma non cancella quello che i modelli precedenti hanno già appreso e non impedisce ad altri siti di descriverti: è la metà lenta del quadro, quella che raccontiamo in Come i modelli AI scelgono quali brand citare. Chi ha potere contrattuale sui propri contenuti, come gli editori, spesso blocca. Chi vuole essere consigliato, di solito ammette.

Serve un llms.txt per dire ai crawler AI cosa leggere?

Per la Ricerca Google no. Nel changelog di Search Central del 15 giugno 2026, Google ha chiarito che i file llms.txt non sono necessari per la Ricerca, che non peggiorano né migliorano visibilità e posizionamento, e che tenerli per altri servizi o sistemi che li usano va benissimo (Google Search Central). La guida sull'ottimizzazione per le funzioni AI dice la stessa cosa in generale: non servono nuovi file leggibili dalle macchine, file di testo per l'AI o markup dedicati, e non esiste uno schema specifico per l'AI da aggiungere (Google Search Central).

Anche OpenAI, Anthropic e Perplexity documentano il robots.txt, non un llms.txt, come modo per controllare i loro crawler. La conclusione è poco spettacolare e molto utile: il robots.txt è la superficie di controllo che esiste davvero, e Google aggiunge che le buone pratiche SEO restano rilevanti perché le sue funzioni di AI generativa poggiano sui sistemi di ranking e di qualità della Ricerca.

Come controllare cosa stai permettendo oggi

  1. Apri il tuo robots.txt e rileggilo con la tabella qui sopra a fianco. Un Disallow: / generico sotto User-agent: * è il modo più diffuso di togliersi dalla ricerca AI senza volerlo.
  2. Decidi per lavoro, non per fornitore. Ammetti OAI-SearchBot, Claude-SearchBot e PerplexityBot. Poi scegli a parte su GPTBot, ClaudeBot e Google-Extended.
  3. Verifica che i bot vedano davvero i contenuti. Una regola che ammette un crawler non vale nulla se la pagina si costruisce nel browser e risponde con un documento vuoto: è il problema di rendering descritto in Come i modelli AI scelgono quali brand citare.
  4. Controlla il traffico nei log. Ogni fornitore pubblica gli intervalli di IP dei suoi agenti, per esempio in openai.com/searchbot.json, openai.com/gptbot.json e www.perplexity.com/perplexitybot.json, perché il solo nome dello user agent non prova niente.
  5. Rimisura dopo. L'accesso è il pavimento, non il risultato.

Quando i bot giusti riescono a leggere le tue pagine, la domanda aperta resta se gli assistenti ti nominino. Sui piani a pagamento, Huntair SEO traccia i prompt che scegli su ChatGPT, Gemini, Claude e Perplexity insieme alle keyword che scegli su Google SERP, così l'accesso dei crawler e il suo risultato stanno nello stesso posto invece che in due.

FAQ

Devo bloccare GPTBot?

Solo se non vuoi che i tuoi testi contribuiscano all'addestramento dei modelli futuri. È una decisione di licenza sui contenuti, senza vantaggi per la visibilità, e non tocca la ricerca di ChatGPT, perché OpenAI documenta OAI-SearchBot come il token che porta i siti lì.

Bloccare i crawler di addestramento mi fa sparire dalle risposte AI?

No, se lasci ammessi i crawler di ricerca. OpenAI, Anthropic e Perplexity documentano token separati per la ricerca e per l'addestramento, e Google dichiara che Google-Extended non incide su inclusione e posizionamento nella Ricerca. L'errore da evitare è la regola generica che prende tutti i bot insieme.

Se ammetto i bot giusti, comparirò su ChatGPT?

Ammetterli è la condizione necessaria, non la garanzia. Con l'accesso aperto diventi un candidato: da lì contano pagine leggibili senza JavaScript, risposte riprendibili in poche righe e un'entità coerente. Il posizionamento su ChatGPT si misura come tasso di menzione su prompt ripetuti, non come una posizione fissa.

Come faccio a capire se un crawler AI è vero o finto?

Dall'indirizzo IP, non dal nome. Lo user agent si copia in un secondo, quindi uno scraper può presentarsi come GPTBot o PerplexityBot. OpenAI e Perplexity pubblicano file JSON con gli intervalli di IP dei loro agenti: confronta l'IP della richiesta prima di fidarti dell'etichetta.

I crawler AI eseguono il JavaScript come Googlebot?

In generale no, ed è il motivo per cui il rendering lato server o il prerender delle pagine pubbliche pesa più per la visibilità AI che per la ricerca classica. Le misure dietro questa affermazione, e cosa comportano per una pagina che costruisce i contenuti nel browser, sono in Come i modelli AI scelgono quali brand citare.

Fonti

  1. Overview of OpenAI crawlers, OpenAI, consultato il
  2. Does Anthropic crawl data from the web, and how can site owners block the crawler?, Anthropic,
  3. Perplexity crawlers, Perplexity, consultato il
  4. List of Google's common crawlers, Google Search Central,
  5. Clarifying guidance on llms.txt files (changelog di Search Central), Google Search Central,
  6. Google's guide to optimizing for generative AI features on Google Search, Google Search Central,

Leggere è il primo passo. Misurare è il secondo.

Richiedi la mia analisi gratuita arrow_forward