Generatore Robots.txt
Usa * per tutti i bot, oppure un nome specifico come Googlebot
Salva questo contenuto in un file chiamato robots.txt nella root del tuo sito.
Domande Frequenti
Tutto quello che devi sapere sul file robots.txt
A cosa serve il file robots.txt?
Il file robots.txt indica ai crawler dei motori di ricerca quali parti del sito possono o non possono scansionare. Va posizionato nella root del dominio (es. https://esempio.com/robots.txt). Attenzione: e una direttiva, non un meccanismo di sicurezza; una pagina bloccata puo comunque essere indicizzata se altri siti la linkano.
Qual e la differenza tra Allow e Disallow?
Disallow blocca l'accesso dei crawler a un percorso, mentre Allow lo consente esplicitamente. Allow e utile per creare eccezioni: ad esempio puoi bloccare /admin/ ma consentire /admin/pubblico/. Una riga "Disallow:" vuota consente l'accesso a tutto il sito, mentre "Disallow: /" blocca l'intero sito.
Tutti i motori di ricerca rispettano il crawl-delay?
No. La direttiva Crawl-delay indica ai bot quanti secondi attendere tra una richiesta e l'altra, ma non tutti la rispettano. Bing e Yandex la supportano, mentre Google la ignora: per Google la frequenza di scansione va gestita da Google Search Console. Usa il crawl-delay solo se il tuo server ha problemi di carico.
robots.txt 有什么用?
它告诉搜索引擎的爬虫,网站的哪些部分可以抓取。文件放在域名根目录,而且只是一种请求:被屏蔽的页面,知道地址的人照样能打开。
Allow 和 Disallow 有什么区别?
Disallow 关闭某个路径的抓取,Allow 显式放行,用于例外:可以屏蔽一个目录,同时放行它下面的某个子目录。空的 Disallow 表示整站允许。
所有搜索引擎都遵守抓取延迟吗?
不是。Bing 和 Yandex 会参考,Google 会忽略,它的抓取频率要在 Search Console 里设置。但对付比较激进的爬虫,它仍然有用。