Strumenti / Generatore robots.txt IA
🚦 Gratuito e illimitato

Generatore di robots.txt per i crawler IA

Autorizzate o bloccate ogni crawler IA con cognizione di causa, poi copiate il blocco da aggiungere al vostro robots.txt.

GPTBot e OAI-SearchBot: due decisioni, non una

GPTBot raccoglie pagine per addestrare i modelli OpenAI. Bloccarlo non ha alcun effetto sulla vostra presenza dentro ChatGPT. OAI-SearchBot, invece, alimenta l'indice di ricerca di ChatGPT: è lui a decidere se la vostra pagina può essere recuperata, riassunta e citata con un link. Bloccarlo vi toglie dalle risposte di ChatGPT. Molti siti hanno copiato un blocco di GPTBot aggiungendoci OAI-SearchBot «per sicurezza», eliminandosi da soli proprio dal canale di traffico che volevano conquistare. Decidete riga per riga, non in blocco.

Preimpostazioni
Apre tutto ciò che può citarvi, chiude i collettori che non citano mai.
GPTBot OpenAI Addestramento

Raccoglie pagine per l'addestramento dei modelli OpenAI.

Bloccarlo non vi toglie dalle risposte di ChatGPT. È una decisione sui vostri dati, non sulla vostra visibilità.

OAI-SearchBot OpenAI Ricerca e citazione

Indicizza le pagine per la ricerca di ChatGPT.

È questo crawler a determinare la vostra presenza e il vostro link nelle risposte di ChatGPT. Bloccarlo vi cancella dalle citazioni.

OAI-AdsBot OpenAI Pubblicità

Controlla le landing page usate dagli annunci ChatGPT Ads.

Necessario se contate di acquistare pubblicità dentro ChatGPT: senza di lui le vostre landing page non possono essere convalidate.

ChatGPT-User OpenAI Visita innescata da un utente

Va a prendere una pagina in diretta perché un utente ne ha condiviso il link o vi ha posto una domanda sopra.

Traffico innescato da una persona reale, in tempo reale. Bloccarlo equivale a rifiutare una visita richiesta esplicitamente.

ClaudeBot Anthropic Addestramento

Raccoglie pagine per i modelli Claude.

Anthropic usa anche Claude-User per i recuperi in diretta e Claude-SearchBot per la ricerca: sono agenti distinti, da trattare separatamente.

PerplexityBot Perplexity Ricerca e citazione

Indicizza le pagine per le risposte con fonti di Perplexity.

Perplexity mostra sistematicamente le sue fonti. Bloccarlo significa rinunciare a quelle citazioni e al traffico che ne deriva.

Google-Extended Google Addestramento

Token che controlla l'uso dei vostri contenuti per Gemini e per l'ancoraggio delle risposte.

Non è un crawler: non cambia né la vostra indicizzazione né il vostro posizionamento in Google Search.

CCBot Common Crawl Addestramento

Costituisce un corpus pubblico riutilizzato da numerosi addestramenti.

Nessun beneficio diretto di visibilità: Common Crawl non cita nessuno. È il primo candidato al blocco se proteggete i vostri contenuti.

Bytespider ByteDance Addestramento

Raccoglie pagine per i modelli di ByteDance.

Noto per un ritmo di crawl aggressivo. Molti siti lo bloccano per ragioni di carico sul server tanto quanto per ragioni di diritti.

meta-externalagent Meta Addestramento

Raccoglie pagine per i modelli di Meta e per Meta AI.

Meta usa più agenti. Questo è il crawler documentato per l'addestramento.

Applebot-Extended Apple Addestramento

Token che controlla l'uso dei vostri contenuti per Apple Intelligence.

Non tocca Applebot, che alimenta Siri e Spotlight: la vostra presenza nella ricerca Apple non viene intaccata.

Uno per riga. Utile per un'area clienti, un carrello o una zona di test.
Aggiunta in fondo al file. Lasciate vuoto per ometterla.
Gratuito, illimitato, senza account

Questo strumento funziona interamente nel vostro browser. Nessun dato inserito qui raggiunge i nostri server, nulla viene salvato, non c'è alcun account da creare né alcuna quota da rispettare. Possiamo quindi offrirlo senza contropartita: non ci costa nulla.

Che cosa fa questo strumento

Un robots.txt mal calibrato è il modo più rapido per sparire dalle risposte IA senza accorgersene. La confusione più frequente e più costosa riguarda OpenAI: GPTBot e OAI-SearchBot non fanno lo stesso lavoro, e bloccare l'uno al posto dell'altro ha conseguenze opposte. Questo strumento mostra il ruolo reale di ogni crawler prima di lasciarvi decidere.

  • Undici crawler IA coperti, ciascuno con il suo ruolo reale: addestramento, ricerca e citazione, visita innescata da un utente, pubblicità.
  • Quattro preimpostazioni, tra cui una che conserva le citazioni rifiutando la raccolta per l'addestramento.
  • Aggiunta di percorsi vietati che si applicano ai crawler che lasciate passare, per proteggere un'area clienti o un carrello.
  • Riga Sitemap aggiunta in fondo al file, e commenti che ricordano il ruolo di ogni crawler.
  • Generazione locale: il file è costruito nel vostro browser, nulla viene trasmesso.

Domande frequenti

Bloccare GPTBot mi fa sparire da ChatGPT?
No. GPTBot serve all'addestramento dei modelli. Ciò che determina la vostra presenza nelle risposte di ChatGPT è OAI-SearchBot, più ChatGPT-User per i recuperi in diretta. Potete benissimo rifiutare l'addestramento restando perfettamente citabili.
I crawler rispettano davvero robots.txt?
Gli agenti documentati di OpenAI, Anthropic, Google, Apple e Perplexity dichiarano di rispettarlo, e in pratica lo fanno. robots.txt resta una convenzione, non una barriera tecnica. Se dovete davvero impedire un accesso, serve un blocco a livello di firewall applicativo o di CDN, con verifica sugli intervalli di indirizzi IP pubblicati.
Dove va collocato questo file?
Alla radice del dominio, e soltanto lì: https://esempio.com/robots.txt. Un file collocato in una sottocartella non viene mai letto. Ogni sottodominio ha il proprio robots.txt.
Posso bloccare solo una parte del sito?
Sì. Il campo dei percorsi vietati aggiunge righe Disallow a ogni crawler che lasciate autorizzato: mantengono l'accesso al sito ma non a quelle cartelle. È l'approccio giusto per un'area clienti o per un funnel d'acquisto.
Come verifico che le mie regole siano applicate?
Guardate i log del vostro server: sono loro a dire quali crawler passano davvero e su che cosa. È esattamente il lavoro del nostro analizzatore di log dei crawler IA, che individua anche i blocchi involontari dovuti al firewall o al CDN.

Andare oltre il generatore

Questi micro-strumenti producono un file. Gli scanner Ready2GEO, invece, vanno a vedere che cosa succede davvero sul vostro sito e dentro le risposte dei motori IA.

Tutti gli strumenti Ready2GEO