robots.txt 生成
在线生成 robots.txt 规则。
什么是robots.txt 生成?
robots.txt 是放在网站根目录(如 `example.com/robots.txt`)的一个纯文本文件,用来告诉搜索引擎和其他遵守协议的爬虫“网站的哪些路径可以抓取、哪些不希望被抓取”。它由一组组规则组成,每组包含 `User-agent`(指定针对哪个爬虫,如 `Googlebot` 或 `*` 表示所有爬虫)和 `Disallow` / `Allow`(禁止或允许抓取的路径),此外还可以声明 `Sitemap` 字段指向站点地图地址。 这个工具提供可视化表单,让你填写针对不同爬虫的允许 / 禁止路径、站点地图地址等,然后自动生成符合语法规范的 robots.txt 文本,不需要死记语法格式。
为什么使用robots.txt 生成?
几乎每个正式上线的网站都需要一份 robots.txt:控制后台管理页面、搜索结果页、临时测试路径不被搜索引擎收录;给 AI 抓取工具(如 GPTBot)单独设置允许或禁止规则;或者简单地为所有爬虫声明站点地图位置帮助收录。手写 robots.txt 时容易出现路径写错、大小写敏感疏忽、忘记给不同爬虫分组等问题,一旦写错可能导致整站被禁止抓取(比如误写了 `Disallow: /`)这种严重后果。 用生成器可以按可视化表单逐项确认规则,直观地看到哪些路径被禁止、哪些爬虫被针对性处理,降低出错概率,尤其适合不熟悉 robots.txt 语法细节的运营或产品同学操作。
使用示例
屏蔽后台目录、开放全站
设置:User-agent 为 `*`,Disallow 填 `/admin/` 和 `/api/`,Allow 保持默认。生成结果: `User-agent: *` `Disallow: /admin/` `Disallow: /api/` 表示禁止所有爬虫抓取 /admin/ 和 /api/ 路径,其余路径默认允许。
针对特定爬虫单独设置
针对 `GPTBot` 单独添加一组规则 Disallow 为 `/`,其余爬虫沿用 `*` 规则允许全站抓取,生成结果里会分别出现两组 User-agent 段落,实现“只禁止某一个 AI 爬虫、其余正常放行”的效果。
补充站点地图声明
在生成器中填入 Sitemap 地址 `https://example.com/sitemap.xml`,生成结果末尾会自动追加一行 `Sitemap: https://example.com/sitemap.xml`,帮助搜索引擎更快发现站内所有页面。
使用提示
生成后建议先在测试环境或用搜索引擎自带的 robots.txt 测试工具校验一遍规则效果,确认关键页面(尤其是首页和核心内容页)没有被误禁止抓取,再部署到生产环境的根目录。
常见问题
Allow/Disallow 怎么填?
Sitemap 地址是必填的吗?
数据会上传服务器吗?
robots.txt 能阻止别人访问我的页面吗?
写错 robots.txt 会有什么后果?
robots.txt 必须放在网站根目录吗?
屏蔽某个路径是不是就不会被收录了?
相关工具
← 返回工具箱· 数据均在浏览器本地处理,不上传服务器。