Generatore di robots.txt per i crawler IA
Autorizzate o bloccate ogni crawler IA con cognizione di causa, poi copiate il blocco da aggiungere al vostro robots.txt.
GPTBot raccoglie pagine per addestrare i modelli OpenAI. Bloccarlo non ha alcun effetto sulla vostra presenza dentro ChatGPT. OAI-SearchBot, invece, alimenta l'indice di ricerca di ChatGPT: è lui a decidere se la vostra pagina può essere recuperata, riassunta e citata con un link. Bloccarlo vi toglie dalle risposte di ChatGPT. Molti siti hanno copiato un blocco di GPTBot aggiungendoci OAI-SearchBot «per sicurezza», eliminandosi da soli proprio dal canale di traffico che volevano conquistare. Decidete riga per riga, non in blocco.
Raccoglie pagine per l'addestramento dei modelli OpenAI.
Bloccarlo non vi toglie dalle risposte di ChatGPT. È una decisione sui vostri dati, non sulla vostra visibilità.
Indicizza le pagine per la ricerca di ChatGPT.
È questo crawler a determinare la vostra presenza e il vostro link nelle risposte di ChatGPT. Bloccarlo vi cancella dalle citazioni.
Controlla le landing page usate dagli annunci ChatGPT Ads.
Necessario se contate di acquistare pubblicità dentro ChatGPT: senza di lui le vostre landing page non possono essere convalidate.
Va a prendere una pagina in diretta perché un utente ne ha condiviso il link o vi ha posto una domanda sopra.
Traffico innescato da una persona reale, in tempo reale. Bloccarlo equivale a rifiutare una visita richiesta esplicitamente.
Raccoglie pagine per i modelli Claude.
Anthropic usa anche Claude-User per i recuperi in diretta e Claude-SearchBot per la ricerca: sono agenti distinti, da trattare separatamente.
Indicizza le pagine per le risposte con fonti di Perplexity.
Perplexity mostra sistematicamente le sue fonti. Bloccarlo significa rinunciare a quelle citazioni e al traffico che ne deriva.
Token che controlla l'uso dei vostri contenuti per Gemini e per l'ancoraggio delle risposte.
Non è un crawler: non cambia né la vostra indicizzazione né il vostro posizionamento in Google Search.
Costituisce un corpus pubblico riutilizzato da numerosi addestramenti.
Nessun beneficio diretto di visibilità: Common Crawl non cita nessuno. È il primo candidato al blocco se proteggete i vostri contenuti.
Raccoglie pagine per i modelli di ByteDance.
Noto per un ritmo di crawl aggressivo. Molti siti lo bloccano per ragioni di carico sul server tanto quanto per ragioni di diritti.
Raccoglie pagine per i modelli di Meta e per Meta AI.
Meta usa più agenti. Questo è il crawler documentato per l'addestramento.
Token che controlla l'uso dei vostri contenuti per Apple Intelligence.
Non tocca Applebot, che alimenta Siri e Spotlight: la vostra presenza nella ricerca Apple non viene intaccata.
Aggiungete questo blocco al vostro robots.txt esistente, alla radice del dominio. Non sovrascrivete le regole attuali: robots.txt si legge per gruppo User-agent, le vostre continuano ad applicarsi agli altri crawler.
Questo strumento funziona interamente nel vostro browser. Nessun dato inserito qui raggiunge i nostri server, nulla viene salvato, non c'è alcun account da creare né alcuna quota da rispettare. Possiamo quindi offrirlo senza contropartita: non ci costa nulla.
Che cosa fa questo strumento
Un robots.txt mal calibrato è il modo più rapido per sparire dalle risposte IA senza accorgersene. La confusione più frequente e più costosa riguarda OpenAI: GPTBot e OAI-SearchBot non fanno lo stesso lavoro, e bloccare l'uno al posto dell'altro ha conseguenze opposte. Questo strumento mostra il ruolo reale di ogni crawler prima di lasciarvi decidere.
- Undici crawler IA coperti, ciascuno con il suo ruolo reale: addestramento, ricerca e citazione, visita innescata da un utente, pubblicità.
- Quattro preimpostazioni, tra cui una che conserva le citazioni rifiutando la raccolta per l'addestramento.
- Aggiunta di percorsi vietati che si applicano ai crawler che lasciate passare, per proteggere un'area clienti o un carrello.
- Riga Sitemap aggiunta in fondo al file, e commenti che ricordano il ruolo di ogni crawler.
- Generazione locale: il file è costruito nel vostro browser, nulla viene trasmesso.
Domande frequenti
Bloccare GPTBot mi fa sparire da ChatGPT?
I crawler rispettano davvero robots.txt?
Dove va collocato questo file?
Posso bloccare solo una parte del sito?
Come verifico che le mie regole siano applicate?
Andare oltre il generatore
Questi micro-strumenti producono un file. Gli scanner Ready2GEO, invece, vanno a vedere che cosa succede davvero sul vostro sito e dentro le risposte dei motori IA.
Verifica se il vostro sito è realmente idoneo e utilizzabile dalla piattaforma pubblicitaria di ChatGPT: accesso dei crawler, struttura, segnali commerciali.
Testare il mio sito 🕷️ Analizzatore di log dei crawler IAIncollate i log del vostro server: vedete quali crawler IA passano davvero, con quale frequenza e su quali pagine si arenano.
Analizzare i miei log 🧭 Audit GEO completoL'audit in bundle aggrega tutti gli scanner in un unico report, con le correzioni ordinate per priorità e l'esportazione PDF.
Avviare l'audit