分类: 开发工具
Robots.txt 生成器
生成包含允许、禁止和 Sitemap 规则的 robots.txt 文件
设置 User-agent、允许与禁止的路径、可选的 Crawl-delay 以及 Sitemap 地址,即可生成一份可直接使用的 robots.txt 文件。全部处理都在浏览器中完成。
robots.txt
robots.txt
User-agent: * Allow: / Disallow: /admin/ Disallow: /private/ Sitemap: https://example.com/sitemap.xml
本页的所有处理都在浏览器中完成,不会上传任何内容。
这个工具能做什么
robots.txt 文件用于告诉搜索引擎爬虫网站的哪些部分可以抓取、哪些不可以,还可以指向 Sitemap 地址。本工具会根据 User-agent、允许路径列表、禁止路径列表、可选的 Crawl-delay 以及 Sitemap 地址,生成一份格式规范的文件。
使用方法
- 设置 User-agent,或保留为 * 以匹配所有爬虫。
- 逐行列出允许和禁止的路径,并添加 Sitemap 地址。
- 将生成的 robots.txt 复制到你网站的根目录。
隐私说明
本工具完全在你的浏览器中运行。输入的内容不会被上传、保存或分享,关闭标签页即随之消失。
常见问题
- 关于我网站的任何信息会被发送出去吗?
- 不会。文件是根据你的输入在页面内运行的 JavaScript 中拼装而成的,不会有任何内容被上传。
- robots.txt 需要放在哪里?
- 需要放在域名的根目录下,例如 https://example.com/robots.txt,这样爬虫才能在请求其他页面之前先找到它。
- 所有爬虫都会遵守 Crawl-delay 吗?
- 不会。Crawl-delay 是一种被广泛支持的约定,但并非正式标准,因此有些爬虫会完全忽略它。