保持规则最小且可解释
优先按目录组织规则,避免堆积大量重复 URL。任何阻止 CSS、JavaScript 或关键页面的规则都应在发布前复核。
站长技术 SEO 与 AI 可发现性指南
了解 robots.txt、sitemap.xml、llms.txt 如何协同工作。
输入域名时默认检测根目录 /robots.txt;输入完整文件地址时将检测该地址。
robots.txt 是部署在域名根目录的爬虫访问规则文件,用于告诉遵守协议的抓取程序哪些路径可以或不可以请求。它适合管理抓取范围与抓取资源消耗,但不能替代页面级 noindex、权限认证或内容下线策略。
一个看似很小的配置错误,可能让重要资源不再被抓取,也可能让 Sitemap 入口难以发现。本检测器会检查文件存在性、指令格式、规则冲突、Sitemap 有效性和 500 KB 限制。需要注意,Crawl-delay 可被工具识别用于审计,但 Google 官方支持的 robots.txt 字段不包含 Crawl-delay。
优先按目录组织规则,避免堆积大量重复 URL。任何阻止 CSS、JavaScript 或关键页面的规则都应在发布前复核。
在文件中加入完整的 Sitemap URL,并确保目标可访问、XML 有效,便于搜索引擎发现站点的重要入口。
敏感页面应通过认证保护;不希望被索引的可访问页面应采用适合的索引控制方案,而不是只依赖 Disallow。
Google 仅处理 robots.txt 的前 500 KiB 内容。配置接近上限时应合并规则并重新检查。
不可靠。robots.txt 主要控制抓取,无法保证一个已被其他链接发现的 URL 不出现在搜索结果中。
声明完整 Sitemap 地址能给支持该指令的搜索引擎提供统一的发现入口,也方便站点审计时确认提交位置。
空的 Disallow 表示没有被该行禁止的路径,也就是允许抓取,容易与“禁止全部”混淆,因此工具会提示检查。
Google 官方 robots.txt 文档不支持 Crawl-delay。需要调整 Google 抓取行为时,应采用 Google 提供的相关管理方式。