I modelli AI portano i brand nelle loro risposte attraverso due porte: ciò che hanno appreso durante l'addestramento (la loro memoria a lungo termine del web) e ciò che recuperano in tempo reale quando cercano per rispondere a una domanda. Un brand può essere noto nei dati di addestramento, facile da recuperare sul web live, entrambe le cose o nessuna delle due. Farsi citare significa capire quale porta puoi aprire, e ogni porta ha regole e tempi diversi.
Questo articolo guarda sotto il cofano. Per il quadro generale, parti da Cos'è la GEO: guida pratica.
Punti chiave
- I brand entrano nelle risposte AI da due porte: i dati di addestramento (si muovono in mesi) e il retrieval in diretta (si muove in settimane).
- Il retrieval si perde in tre stadi: pagina non trovata (i crawler di ricerca AI non l'hanno mai indicizzata), non leggibile (pagine solo JavaScript) o non citabile (nessuna risposta riprendibile).
- I modelli preferiscono i brand non ambigui: stesso nome, stessa categoria e stessa descrizione ovunque valgono come un fattore di ranking.
- Apri prima la porta del retrieval: è rapida, misurabile e completamente sotto il tuo controllo.
Porta uno: ciò che il modello già "sa"
I grandi modelli linguistici vengono addestrati su una fotografia del web, di libri e altri testi. Durante l'addestramento, un brand che compare spesso (in articoli, recensioni, forum, documentazione) entra nella conoscenza parametrica del modello: il modello sa nominarlo, descriverlo e raccomandarlo senza cercare nulla.
Cosa determina la tua presenza in questa memoria:
- Volume e ampiezza delle menzioni. Non solo il tuo sito: stampa, articoli di confronto, discussioni nelle community, directory. Un brand descritto da molte fonti indipendenti viene codificato più in profondità.
- Coerenza. Se metà del web ti chiama "un CRM" e l'altra metà "una suite di marketing", l'immagine del modello si sfoca, e le entità sfocate vengono saltate quando il modello vuole suonare sicuro.
- Tempo. Le fotografie di addestramento sono indietro di mesi rispetto alla realtà. Un brand che ha sistemato il posizionamento la settimana scorsa viene descritto alla vecchia maniera finché i modelli non si riaddestrano.
Questa porta la influenzi lentamente, con PR classiche, recensioni e messaggi di brand coerenti. È la metà "notorietà offline" della visibilità: quella che Huntair misura con un punteggio separato, il Brand Knowledge, proprio perché si muove su un orologio diverso.
Porta due: ciò che il modello recupera in diretta
Quando una domanda richiede informazioni attuali o specifiche, i modelli cercano nel web e leggono le pagine prima di rispondere (retrieval-augmented generation). È da qui che arriva la maggior parte delle citazioni con link, ed è la porta che puoi aprire in settimane, non in mesi.
La pipeline ha tre stadi, e puoi perdere a ciascuno:
Stadio 1 (retrieval): la tua pagina viene trovata?
Il modello trasforma la domanda dell'utente in query di ricerca e pesca pagine candidate da un indice. Due fatti duri:
- La copertura degli indici decide l'eleggibilità. Ogni provider documenta il proprio crawler di ricerca: OAI-SearchBot porta i siti nei risultati di ricerca di ChatGPT, Claude-SearchBot lavora sulla qualità della ricerca per Claude e PerplexityBot porta e linka i siti nei risultati di Perplexity, che Perplexity dichiara non essere usato per raccogliere contenuti destinati ai modelli di base. Se uno di loro non riesce a leggere le tue pagine, per quell'assistente sei invisibile, per quanto siano buoni i tuoi contenuti. I fetcher attivati dall'utente sono un caso a parte: ChatGPT-User, Claude-User e Perplexity-User leggono una pagina perché una persona l'ha chiesta. OpenAI scrive che le regole del robots.txt possono non applicarsi a ChatGPT-User e Perplexity che Perplexity-User in genere le ignora, mentre Anthropic dichiara che i suoi bot rispettano le direttive del robots.txt.
- Il ranking conta ancora. Il retrieval privilegia pagine che già si posizionano bene per le query sottostanti. È il senso concreto in cui la GEO si costruisce sopra la SEO.
Stadio 2 (lettura): il crawler riesce a vedere i contenuti?
La pagina recuperata deve essere leggibile dal crawler AI, e la maggior parte di essi non esegue JavaScript. In un'analisi di dicembre 2024 su circa 1,3 miliardi di fetch mensili dei crawler AI sulla loro rete, Vercel e MERJ hanno rilevato che nessuno dei principali crawler AI eseguiva JavaScript e che i crawler di ChatGPT e Claude scaricavano i file degli script rispettivamente nell'11,5% e nel 23,8% delle richieste senza eseguirli. Googlebot si comporta in modo diverso: nello studio gemello di luglio 2024 ha renderizzato per intero il 100% delle pagine HTML indicizzabili che ha richiesto sul sito strumentato, con una mediana di 10 secondi dopo la scansione. Una pagina che si costruisce lato client per i crawler AI è quindi un documento vuoto, e questo squalifica interi siti dalle risposte AI, compresi siti che su Google si posizionano bene. Server-side rendering o prerender delle pagine pubbliche, più un robots.txt che lasci passare i bot di ricerca AI (OAI-SearchBot, Claude-SearchBot, PerplexityBot), sono il biglietto d'ingresso. I bot di addestramento come GPTBot e ClaudeBot sono una scelta a parte: bloccarli riguarda l'addestramento dei modelli, non i risultati della ricerca AI.
Stadio 3 (selezione): il modello cita proprio te?
Dalle pagine lette, il modello compone la risposta e sceglie quali fonti citare. Qui vince il contenuto facile da citare:
- Risposte dirette subito. Una risposta autosufficiente di due o tre frasi in cima a una sezione può essere ripresa alla lettera. Le risposte sepolte al settimo paragrafo raramente ce la fanno.
- Struttura a domande. Titoli che rispecchiano le vere domande degli utenti aiutano il modello a mappare "quale sezione risponde a questo?".
- Definizioni e dati. Definizioni nette, statistiche, benchmark e ricerche originali sono i contenuti più citati: un numero con una fonte batte un'opinione ogni volta.
- Autorialità e freschezza chiare. Pagine che dicono chi le ha scritte, quando e con quale competenza danno al modello ragioni per fidarsi della citazione.
Perché i modelli "preferiscono" risposte sicure e note?
Oltre alla meccanica c'è un bias da conoscere: i modelli sono messi a punto per evitare risposte sbagliate dette con sicurezza. Davanti a una richiesta di raccomandazioni, tendono verso i brand su cui molte fonti concordano: descritti spesso, descritti in modo coerente, categorizzati chiaramente. La conseguenza pratica: essere non ambigui è un fattore di ranking. Stesso nome, stessa categoria, stessa descrizione in una riga, ovunque. Un modello che sceglie tra un brand definito nitidamente e uno vago sceglie quello nitido, perché può descriverlo senza rischio.
Cosa puoi influenzare davvero, e quanto in fretta?
| Leva | Porta | Tempi |
|---|---|---|
| Farsi indicizzare dai crawler di ricerca AI e da Googlebot | Retrieval | Giorni-settimane |
| Pagine leggibili senza JS; bot di ricerca AI ammessi | Lettura | Immediato al deploy |
| Contenuti answer-first, titoli-domanda, FAQ | Selezione | Settimane |
| Pubblicare dati e definizioni originali | Selezione + addestramento | Settimane, cumulativo |
| Entità coerente in tutto il web | Selezione + addestramento | Mesi |
| PR, recensioni, menzioni indipendenti | Addestramento | Mesi-aggiornamenti dei modelli |
La strategia si scrive da sola: apri prima la porta del retrieval (è veloce e interamente sotto il tuo controllo), poi investi nell'accumulo lento della presenza nei dati di addestramento.
FAQ
I modelli AI hanno un algoritmo di ranking come Google?
Non nello stesso senso. Il retrieval usa un ranking in stile motore di ricerca per selezionare le pagine candidate, ma la scelta finale di cosa citare avviene dentro il modello mentre compone la risposta, privilegiando contenuti leggibili, citabili e coerenti con ciò che dicono le altre fonti.
Perché ChatGPT cita il mio competitor e non me?
Di solito per una di tre ragioni, in ordine di probabilità: le tue pagine non sono recuperabili (bloccate o mai indicizzate dal crawler di ricerca di quell'assistente, o illeggibili senza JavaScript), i tuoi contenuti non offrono una risposta riprendibile dove i loro sì, oppure i dati di addestramento del modello li conoscono semplicemente meglio. Le prime due si sistemano in settimane e si misurano, come mostriamo in Come scoprire se ChatGPT cita il tuo brand.
llms.txt influenza le citazioni?
Nella documentazione di Google, OpenAI, Anthropic e Perplexity non c'è nulla che lo indichi. llms.txt è una convenzione facoltativa: una mappa in testo semplice del sito per i sistemi AI, su /llms.txt. Google dichiara che Google Search lo ignora e che non aiuta né penalizza il posizionamento (Google Search Central). OpenAI, Anthropic e Perplexity indicano il robots.txt come lo strumento per gestire i loro crawler (OpenAI, Anthropic, Perplexity). Puoi pubblicarlo se ti serve per altri strumenti, ma prima conviene lavorare su recuperabilità e contenuti citabili.
Posso pagare per essere citato?
Nessun modello mainstream oggi vende citazioni nelle risposte organiche. La visibilità si guadagna con la meccanica descritta sopra, ed è esattamente per questo che i brand che investono presto in GEO costruiscono un vantaggio difficile da ricomprare dopo.