🤖 Robots.txt 生成器
为你的网站生成 robots.txt 文件。通过规则和 sitemap 控制爬虫访问——全部在浏览器中运行,无需上传,即时完成。
关于 Robots.txt 生成器
这个 robots.txt 生成器完全在你的浏览器中运行。选择默认规则,添加按 user-agent 的规则,可选地加入 sitemap 指令,工具会生成可直接粘贴的 robots.txt 文件。整个过程不会上传任何数据——生成通过 JavaScript 在你的设备上本地完成。
什么是 robots.txt?
robots.txt 是位于你域名根目录的纯文本文件(例如 https://example.com/robots.txt),告诉爬虫可以访问网站的哪些部分。它使用 Robots Exclusion Protocol,被所有主流搜索引擎(包括 Google、Bing、DuckDuckGo)支持。
关键指令
- User-agent —— 接下来规则所适用的爬虫。
*匹配所有爬虫。 - Allow —— 指定爬虫可以访问的路径。
- Disallow —— 指定爬虫不能访问的路径。
- Sitemap —— 你的 XML sitemap 的绝对 URL。每个
Sitemap:行列出一个 sitemap。
如何使用生成器
- 选择默认规则:全部允许让所有爬虫访问站点,全部禁止关闭访问。
- 用添加规则按钮添加具体规则——选择 user-agent、动作和路径。
- 可选地填写Sitemap URL,让搜索引擎能找到你的 sitemap。
- 点击生成再复制,把结果粘贴到网站根目录下名为
robots.txt的文件中。
常见问题
这个工具会上传我的数据吗? 不会。所有操作都在本地浏览器中完成,输入永远不会离开你的设备。
robots.txt 是安全控制吗? 不是。它是一个请求,不是强制执行。恶意爬虫可以无视它。永远不要用它来隐藏敏感 URL——应该用身份验证来保护这些。
如果误封了 URL 怎么办? 被封的 URL 不会被爬取,但如果其他页面链接到它,仍可能出现在搜索结果中。要完全移除某个 URL,应使用 noindex meta 标签或响应头。
robots.txt 放在哪里? 在域名根目录:https://yourdomain.com/robots.txt。每个主机只接受一个文件。