分类: 开发工具

Robots.txt 生成器

生成包含允许、禁止和 Sitemap 规则的 robots.txt 文件

设置 User-agent、允许与禁止的路径、可选的 Crawl-delay 以及 Sitemap 地址,即可生成一份可直接使用的 robots.txt 文件。全部处理都在浏览器中完成。

robots.txt
robots.txt
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /private/

Sitemap: https://example.com/sitemap.xml

本页的所有处理都在浏览器中完成,不会上传任何内容。

这个工具能做什么

robots.txt 文件用于告诉搜索引擎爬虫网站的哪些部分可以抓取、哪些不可以,还可以指向 Sitemap 地址。本工具会根据 User-agent、允许路径列表、禁止路径列表、可选的 Crawl-delay 以及 Sitemap 地址,生成一份格式规范的文件。

使用方法

  1. 设置 User-agent,或保留为 * 以匹配所有爬虫。
  2. 逐行列出允许和禁止的路径,并添加 Sitemap 地址。
  3. 将生成的 robots.txt 复制到你网站的根目录。

隐私说明

本工具完全在你的浏览器中运行。输入的内容不会被上传、保存或分享,关闭标签页即随之消失。

常见问题

关于我网站的任何信息会被发送出去吗?
不会。文件是根据你的输入在页面内运行的 JavaScript 中拼装而成的,不会有任何内容被上传。
robots.txt 需要放在哪里?
需要放在域名的根目录下,例如 https://example.com/robots.txt,这样爬虫才能在请求其他页面之前先找到它。
所有爬虫都会遵守 Crawl-delay 吗?
不会。Crawl-delay 是一种被广泛支持的约定,但并非正式标准,因此有些爬虫会完全忽略它。