robots.txt 生成

在线生成 robots.txt 规则。

什么是robots.txt 生成?

robots.txt 是放在网站根目录(如 `example.com/robots.txt`)的一个纯文本文件,用来告诉搜索引擎和其他遵守协议的爬虫“网站的哪些路径可以抓取、哪些不希望被抓取”。它由一组组规则组成,每组包含 `User-agent`(指定针对哪个爬虫,如 `Googlebot` 或 `*` 表示所有爬虫)和 `Disallow` / `Allow`(禁止或允许抓取的路径),此外还可以声明 `Sitemap` 字段指向站点地图地址。 这个工具提供可视化表单,让你填写针对不同爬虫的允许 / 禁止路径、站点地图地址等,然后自动生成符合语法规范的 robots.txt 文本,不需要死记语法格式。

为什么使用robots.txt 生成?

几乎每个正式上线的网站都需要一份 robots.txt:控制后台管理页面、搜索结果页、临时测试路径不被搜索引擎收录;给 AI 抓取工具(如 GPTBot)单独设置允许或禁止规则;或者简单地为所有爬虫声明站点地图位置帮助收录。手写 robots.txt 时容易出现路径写错、大小写敏感疏忽、忘记给不同爬虫分组等问题,一旦写错可能导致整站被禁止抓取(比如误写了 `Disallow: /`)这种严重后果。 用生成器可以按可视化表单逐项确认规则,直观地看到哪些路径被禁止、哪些爬虫被针对性处理,降低出错概率,尤其适合不熟悉 robots.txt 语法细节的运营或产品同学操作。

使用示例

屏蔽后台目录、开放全站

设置:User-agent 为 `*`,Disallow 填 `/admin/` 和 `/api/`,Allow 保持默认。生成结果: `User-agent: *` `Disallow: /admin/` `Disallow: /api/` 表示禁止所有爬虫抓取 /admin/ 和 /api/ 路径,其余路径默认允许。

针对特定爬虫单独设置

针对 `GPTBot` 单独添加一组规则 Disallow 为 `/`,其余爬虫沿用 `*` 规则允许全站抓取,生成结果里会分别出现两组 User-agent 段落,实现“只禁止某一个 AI 爬虫、其余正常放行”的效果。

补充站点地图声明

在生成器中填入 Sitemap 地址 `https://example.com/sitemap.xml`,生成结果末尾会自动追加一行 `Sitemap: https://example.com/sitemap.xml`,帮助搜索引擎更快发现站内所有页面。

使用提示

生成后建议先在测试环境或用搜索引擎自带的 robots.txt 测试工具校验一遍规则效果,确认关键页面(尤其是首页和核心内容页)没有被误禁止抓取,再部署到生产环境的根目录。

常见问题

Allow/Disallow 怎么填?
每行一条路径规则,如 /admin、/private/*.pdf;留空 Allow 与 Disallow 时会生成 "Disallow:"(表示允许全部抓取)。
Sitemap 地址是必填的吗?
不是必填,但建议填写完整的 sitemap.xml 绝对地址,方便搜索引擎发现网站地图,加快收录。
数据会上传服务器吗?
不会。robots.txt 内容完全在浏览器本地拼接生成。
robots.txt 能阻止别人访问我的页面吗?
不能。robots.txt 只是一份“君子协议”,遵守规则的正规搜索引擎爬虫会遵循它,但它无法阻止普通用户通过浏览器直接访问,也无法阻止不遵守协议的恶意爬虫,真正需要限制访问权限应使用登录校验、IP 限制等服务器端手段。
写错 robots.txt 会有什么后果?
如果误将 `Disallow: /` 应用到所有爬虫(`User-agent: *`),会导致整个网站都不再被搜索引擎抓取和收录,是最常见也最严重的配置错误,生成前建议仔细核对规则范围。
robots.txt 必须放在网站根目录吗?
是的,标准要求 robots.txt 必须位于站点根路径下(如 `https://example.com/robots.txt`),放在子目录下爬虫不会读取,也不会生效。
屏蔽某个路径是不是就不会被收录了?
禁止抓取和禁止收录并不完全等同:如果其他页面链接到了被 Disallow 的地址,搜索引擎有时仍可能收录该 URL(仅显示地址、没有摘要),如果要彻底阻止收录,通常需要配合页面级的 noindex 元标签或密码保护,而不是只依赖 robots.txt。

相关工具

← 返回工具箱· 数据均在浏览器本地处理,不上传服务器。