robots.txt 测试工具

粘贴 robots.txt 内容,指定 User-agent 和待检测路径,按最长匹配优先规则判断路径是否允许被搜索引擎抓取,支持批量测试多个路径。

免费在线工具
Loading…

使用说明

1. 在「robots.txt 内容」输入框中粘贴完整的 robots.txt 文本(可包含多个 User-agent 分组、Allow/Disallow 规则、注释)。

2. 在「User-agent」输入框中填写要模拟的爬虫名称,例如 Googlebot、Baiduspider,默认值为 *(匹配所有未单独声明的爬虫)。

3. 在「待检测路径」文本框中每行输入一个路径,例如 /admin/index.html,支持一次性输入多行进行批量测试。

4. 点击「测试」按钮,工具会对每个路径给出「允许抓取」或「禁止抓取」的结果,并显示命中的 User-agent 分组与具体匹配到的 Allow/Disallow 规则。

5. 点击「加载示例数据」可以快速填入一份包含通配符规则的示例 robots.txt 和若干测试路径,方便直接体验判断逻辑。

功能介绍

本工具完整实现了 robots.txt 协议中判断某个 User-agent 能否抓取指定路径的核心规则:

  • User-agent 分组匹配:优先精确匹配指定的 User-agent 名称;若没有精确匹配,则尝试包含关系匹配;都没有命中时自动退回到 User-agent: * 分组;如果 robots.txt 里连 * 分组都不存在,则默认允许抓取。
  • 最长匹配路径优先:当同一分组内多条 Allow/Disallow 规则都能匹配到待测路径时,按规则字符串长度取最长的一条生效,长度相同时 Allow 优先于 Disallow,这与 Google、百度等主流搜索引擎的实现一致。
  • 通配符与结尾锚定支持:规则中的 * 会被解析为任意字符通配符,规则末尾的 $ 表示路径必须以该规则结尾才算命中(例如 Disallow: /*.pdf$ 只拦截以 .pdf 结尾的路径)。
  • 批量测试:待检测路径支持多行输入,一次性得到每个路径各自的判定结果,并列出命中的规则明细,便于排查抓取问题。

使用场景

SEO 上线前自查
网站改版或上线新页面前,粘贴线上 robots.txt,逐一测试关键页面路径是否被误屏蔽,避免影响搜索引擎收录。
排查收录异常
发现某个页面长期不被搜索引擎收录时,先检查该路径在对应 User-agent 分组下是否被 Disallow 规则拦截。
验证多爬虫差异化规则
针对 Googlebot、Baiduspider、Bingbot 等不同爬虫设置了不同抓取权限时,逐一切换 User-agent 验证各自的实际生效规则是否符合预期。
排查通配符规则副作用
使用了 <code>*</code> 通配符或 <code>$</code> 结尾锚定的复杂规则容易产生意料之外的匹配,上线前用具体路径逐条验证规则实际命中情况。

常见问题

如果 robots.txt 里没有匹配到我填写的 User-agent,会怎么判断?
工具会自动退回到 <code>User-agent: *</code> 分组进行判断;如果 robots.txt 里连 <code>*</code> 分组也不存在,则该路径默认判定为允许抓取,这与主流搜索引擎的实现保持一致。
同一个路径同时匹配到 Allow 和 Disallow 规则,以哪个为准?
按最长匹配路径优先:规则字符串越长优先级越高;如果两条规则长度相同,则 Allow 优先于 Disallow 生效。
支持 <code>*</code> 通配符和 <code>$</code> 结尾符吗?
支持。<code>*</code> 会被当作任意字符序列处理,规则末尾的 <code>$</code> 表示路径必须精确以该规则结尾才算匹配,例如 <code>Disallow: /*.pdf$</code> 只会拦截以 .pdf 结尾的路径,不会拦截 <code>/report.pdf.html</code>。
可以一次测试多个路径吗?
可以。在「待检测路径」文本框中每行填一个路径,点击测试后会针对每一行分别给出判定结果和命中规则,无需逐个手动测试。
工具会真的联网抓取我的网站吗?
不会。所有判断都基于你粘贴的 robots.txt 文本在浏览器本地解析计算,不会发起任何网络请求,你的网站地址和内容不会被上传。