CRAWL CONTROL

Robots.txt 检测工具

检查爬虫入口配置,让发现路径更可靠。

为爬虫规则和 Sitemap 声明生成健康分。

立即开始无需注册账号

站长技术 SEO 与 AI 可发现性指南

了解 robots.txt、sitemap.xml、llms.txt 如何协同工作。

查看指南 ->

输入域名时默认检测根目录 /robots.txt;输入完整文件地址时将检测该地址。

评分说明

  • 必须项:文件 HTTP 200 +25,语法格式正确 +20,标准指令可识别 +15。
  • 重要项:没有同路径 Allow/Disallow 冲突 +10,声明的 Sitemap 可访问且 XML 有效 +15。
  • 增强项:具体 User-agent 优先排列 +5,无空 Disallow +5,文件不超过 500 KB +5。

关于 robots.txt:先控制抓取,再谈索引效率

robots.txt 是部署在域名根目录的爬虫访问规则文件,用于告诉遵守协议的抓取程序哪些路径可以或不可以请求。它适合管理抓取范围与抓取资源消耗,但不能替代页面级 noindex、权限认证或内容下线策略。

一个看似很小的配置错误,可能让重要资源不再被抓取,也可能让 Sitemap 入口难以发现。本检测器会检查文件存在性、指令格式、规则冲突、Sitemap 有效性和 500 KB 限制。需要注意,Crawl-delay 可被工具识别用于审计,但 Google 官方支持的 robots.txt 字段不包含 Crawl-delay。

Robots.txt 最佳实践

保持规则最小且可解释

优先按目录组织规则,避免堆积大量重复 URL。任何阻止 CSS、JavaScript 或关键页面的规则都应在发布前复核。

明确声明 Sitemap

在文件中加入完整的 Sitemap URL,并确保目标可访问、XML 有效,便于搜索引擎发现站点的重要入口。

不要把 robots 当作隐藏机制

敏感页面应通过认证保护;不希望被索引的可访问页面应采用适合的索引控制方案,而不是只依赖 Disallow。

控制文件体积

Google 仅处理 robots.txt 的前 500 KiB 内容。配置接近上限时应合并规则并重新检查。

常见问题

robots.txt 可以阻止页面出现在搜索结果中吗?

不可靠。robots.txt 主要控制抓取,无法保证一个已被其他链接发现的 URL 不出现在搜索结果中。

为什么要在 robots.txt 中声明 Sitemap?

声明完整 Sitemap 地址能给支持该指令的搜索引擎提供统一的发现入口,也方便站点审计时确认提交位置。

Disallow: 空值有什么含义?

空的 Disallow 表示没有被该行禁止的路径,也就是允许抓取,容易与“禁止全部”混淆,因此工具会提示检查。

Crawl-delay 对 Googlebot 有效吗?

Google 官方 robots.txt 文档不支持 Crawl-delay。需要调整 Google 抓取行为时,应采用 Google 提供的相关管理方式。

Robots.txt 检测工具 - 在线检查爬虫规则 | GoTools