RBV

Robots.txt 校验器

按源行号检查 Google 支持的指令与分组

SEO 与结构化数据
🔒 100% 本地运行 — 你的数据不会离开当前页面
由 Evan 维护•最近更新:2026年9月30日

面向 Google 的 robots.txt 文本检查,保留源行号并识别连续 user-agent 分组。只计入 allow/disallow 抓取规则。检查不模拟匹配优先级,也不判断线上抓取或收录。输入上限 500 KiB、20,000 行。

本工具在页面内处理输入,不请求其中的地址,也不保存输入草稿。站点分析仅记录操作与汇总信息。

页面阅读模式

完整说明还包括常见问题处理、操作示例、代码片段、FAQ 和相关工具,便于核对结果或排查问题。

工具说明

按面向 Google 的规则检查 robots.txt 文本。报告保留源行号,正确合并连续 user-agent 行,只将 allow/disallow 计为抓取规则,并检查 Sitemap HTTP(S) 地址和重复声明。缺少冒号会报错;Google 不支持的 noindex、crawl-delay、host、clean-param 等指令会产生说明适用范围的提醒,其他爬虫可能支持其中部分指令。仅含 Sitemap 或注释的文件可以使用;空的 allow/disallow 值不添加路径限制。工具不重写文件,不模拟 URL 匹配,也不检查线上抓取、HTTP 状态或收录。Disallow 不能保证从搜索中移除 URL。输入上限为 500 KiB、20,000 行。不保存输入草稿,不请求其中的地址;站点分析记录操作和计数。

失败门诊(高频踩坑)

用 robots.txt 的 Noindex 从搜索结果中移除页面

原因:Google 不支持 robots.txt 中的该指令,被禁止抓取的 URL 仍可能被索引。

修复:在 Google 可以抓取的页面使用 robots meta 或 X-Robots-Tag,并用相应搜索工具验证结果。

把 crawl-delay 当成所有爬虫的错误

原因:Google 忽略 crawl-delay,但其他爬虫可能支持。

修复:结合目标爬虫理解提醒;本报告明确面向 Google。

场景配方

01

保留原始行号检查 robots 文件

目标:检查 Google 支持的指令范围,并核对分组边界。

  1. 粘贴文件,保留原有注释和空行。
  2. 查看每条指令的源行号与分组;首条抓取规则之前连续的 user-agent 属于同一组。
  3. 修复错误行和 Sitemap 地址,再根据目标爬虫解释 Google 不支持的指令。

结果:得到带源行号的报告。工具不重写文件,也不模拟具体 URL 是否允许抓取。

生产可用片段

两个 user-agent 可以属于同一组

text

# 原始第 1 行
User-agent: Googlebot
User-agent: Bingbot
Disallow: /private/
Sitemap: https://example.test/sitemap.xml

这里只有一个分组、一条抓取规则。
Sitemap 指令不会结束当前分组。

常见问题

user-agent 分组如何计算?

连续 user-agent 行属于同一组,中间可以包含注释或空行。出现 allow/disallow 规则后,后续 user-agent 才开始新分组。Sitemap 和未知指令不会结束分组。

文件可以只包含 Sitemap 声明吗?

可以。仅含 Sitemap 或注释的文件不必额外添加 user-agent。报告会说明没有发现 allow/disallow 限制。

robots.txt 的 noindex 能移除 Google 结果吗?

Google 不支持 robots.txt 中的 noindex。请在 Google 能够抓取的页面使用 robots meta 或 X-Robots-Tag,并另行核实收录结果。

crawl-delay 对所有爬虫都无效吗?

不是。Google 忽略它,而部分其他爬虫支持它。这里的提醒会明确 Google 的适用边界。

报告能预测某个 URL 是否会被抓取吗?

不能。工具不模拟通配符匹配、规则优先级、爬虫选择、重定向、缓存或 HTTP 失败行为。

工具会上传或保留文件吗?

检查器在本地处理文本,不请求其中的 Sitemap 地址,不保存输入草稿。站点分析记录操作和计数。

继续浏览