🤖 Robots.txt 生成器

为你的网站生成 robots.txt 文件。通过规则和 sitemap 控制爬虫访问——全部在浏览器中运行,无需上传,即时完成。

关于 Robots.txt 生成器

这个 robots.txt 生成器完全在你的浏览器中运行。选择默认规则,添加按 user-agent 的规则,可选地加入 sitemap 指令,工具会生成可直接粘贴的 robots.txt 文件。整个过程不会上传任何数据——生成通过 JavaScript 在你的设备上本地完成。

什么是 robots.txt?

robots.txt 是位于你域名根目录的纯文本文件(例如 https://example.com/robots.txt),告诉爬虫可以访问网站的哪些部分。它使用 Robots Exclusion Protocol,被所有主流搜索引擎(包括 Google、Bing、DuckDuckGo)支持。

关键指令

  • User-agent —— 接下来规则所适用的爬虫。* 匹配所有爬虫。
  • Allow —— 指定爬虫可以访问的路径。
  • Disallow —— 指定爬虫不能访问的路径。
  • Sitemap —— 你的 XML sitemap 的绝对 URL。每个 Sitemap: 行列出一个 sitemap。

如何使用生成器

  1. 选择默认规则全部允许让所有爬虫访问站点,全部禁止关闭访问。
  2. 添加规则按钮添加具体规则——选择 user-agent、动作和路径。
  3. 可选地填写Sitemap URL,让搜索引擎能找到你的 sitemap。
  4. 点击生成复制,把结果粘贴到网站根目录下名为 robots.txt 的文件中。

常见问题

这个工具会上传我的数据吗? 不会。所有操作都在本地浏览器中完成,输入永远不会离开你的设备。

robots.txt 是安全控制吗? 不是。它是一个请求,不是强制执行。恶意爬虫可以无视它。永远不要用它来隐藏敏感 URL——应该用身份验证来保护这些。

如果误封了 URL 怎么办? 被封的 URL 不会被爬取,但如果其他页面链接到它,仍可能出现在搜索结果中。要完全移除某个 URL,应使用 noindex meta 标签或响应头。

robots.txt 放在哪里? 在域名根目录:https://yourdomain.com/robots.txt。每个主机只接受一个文件。