Generatore Robots.txt
Usa * per tutti i bot, oppure un nome specifico come Googlebot
Salva questo contenuto in un file chiamato robots.txt nella root del tuo sito.
Domande Frequenti
Tutto quello che devi sapere sul file robots.txt
A cosa serve il file robots.txt?
Il file robots.txt indica ai crawler dei motori di ricerca quali parti del sito possono o non possono scansionare. Va posizionato nella root del dominio (es. https://esempio.com/robots.txt). Attenzione: e una direttiva, non un meccanismo di sicurezza; una pagina bloccata puo comunque essere indicizzata se altri siti la linkano.
Qual e la differenza tra Allow e Disallow?
Disallow blocca l'accesso dei crawler a un percorso, mentre Allow lo consente esplicitamente. Allow e utile per creare eccezioni: ad esempio puoi bloccare /admin/ ma consentire /admin/pubblico/. Una riga "Disallow:" vuota consente l'accesso a tutto il sito, mentre "Disallow: /" blocca l'intero sito.
Tutti i motori di ricerca rispettano il crawl-delay?
No. La direttiva Crawl-delay indica ai bot quanti secondi attendere tra una richiesta e l'altra, ma non tutti la rispettano. Bing e Yandex la supportano, mentre Google la ignora: per Google la frequenza di scansione va gestita da Google Search Console. Usa il crawl-delay solo se il tuo server ha problemi di carico.
Wozu dient eine Datei robots.txt?
Sie sagt den Crawlern der Suchmaschinen, welche Teile der Website sie durchlaufen dürfen. Sie liegt im Wurzelverzeichnis der Domain und schützt nichts: Eine gesperrte Seite bleibt für jeden erreichbar, der ihre Adresse kennt.
Was unterscheidet Allow und Disallow?
Disallow sperrt einen Pfad für das Crawling, Allow öffnet ihn wieder und ist für die Ausnahmen da: Sie können einen Ordner sperren und einen Unterordner darin erreichbar lassen. Ein leeres Disallow erlaubt alles.
Halten sich alle Suchmaschinen an Crawl-Delay?
Nein. Bing und Yandex beachten es, Google übergeht es, dort stellt man die Crawl-Rate in der Search Console ein. Nützlich bleibt es, um die aggressiveren Crawler zu bremsen.