robots.txt 分组
复查 User-agent 分组、Allow 和 Disallow 规则、Crawl-delay、重复规则、空规则和无效 robots.txt 行。
免费 Robots 和 Sitemap 检查器
把 robots.txt、sitemap.xml 或 sitemap index 内容粘贴到 Robots 和 Sitemap 检查器,工具会自动识别文件类型,并在一个浏览器本地报告中检查常见搜索引擎抓取风险。它把 robots.txt 语法检查和 sitemap XML 检查合并在同一个页面,但不会请求域名或抓取网站。
浏览器本地抓取文件审计
Robots 和 Sitemap 检查器会识别 robots.txt、sitemap.xml 或 sitemap index 内容,并在本地检查规则、XML 结构、URL、重复条目、lastmod 日期和危险抓取阻止模式。
你粘贴的内容会留在当前浏览器标签页。Robots 和 Sitemap 检查器不会请求实时 URL、抓取域名或上传私有 staging 文件。
Robots 和 Sitemap 检查器结果会显示在这里
粘贴或上传 robots.txt、sitemap.xml 或 sitemap index 后,你会看到识别类型、规则分组、禁止抓取路径、Sitemap 地址、URL 数量、重复 URL、无效 loc、lastmod 异常和修复建议。
问题
0
失败
0
提醒
0
通过
0
Robots 和 Sitemap 检查器把 robots.txt 语法复查和 sitemap XML 校验放在一起,因为抓取问题经常同时涉及这两个文件。
粘贴或上传原始 robots.txt、sitemap.xml 或 sitemap index 内容。Robots 和 Sitemap 检查器会识别输入类型,并在浏览器本地运行对应检查,不会抓取域名。
Robots 和 Sitemap 检查器展示 robots 规则分组、禁止抓取路径、Sitemap 指令、URL 数量、重复 URL、无效 loc、lastmod 异常和危险 User-agent 规则。
发布、迁移、staging 交付或 CMS 更新前,如果抓取相关文件需要快速 QA,可以使用 Robots 和 Sitemap 检查器。
复查 User-agent 分组、Allow 和 Disallow 规则、Crawl-delay、重复规则、空规则和无效 robots.txt 行。
标记 User-agent: * 搭配 Disallow: / 的情况,避免 staging 规则误阻止公开站点全站抓取。
检查 sitemap XML 是否能解析,以及根元素是否为 urlset 或 sitemapindex。
在提交 sitemap 前发现空 loc、非 HTTP loc 和重复规范 URL。
发现不像 YYYY-MM-DD 或清晰 ISO 日期时间的 lastmod 值。
在浏览器内运行 Robots 和 Sitemap 检查器,复查草稿和 staging 文件,无需上传内容或抓取 URL。
Robots 和 Sitemap 检查器面向粘贴或上传的文件内容,适合代码仓库、CMS 导出和 staging 交付前的稳定预检查。
把原始 robots.txt、sitemap.xml 或 sitemap index 内容复制到 Robots 和 Sitemap 检查器,或从设备上传 .txt / .xml 文件。
先处理无效 XML、空 loc、无效 loc URL、User-agent: * 搭配 Disallow: / 等失败项,再复查重复规则、Crawl-delay、重复 URL 和 lastmod 异常。
Robots 和 Sitemap 检查器不会测试服务器状态、robots 文件发现、sitemap 提交状态或真实搜索引擎行为。它只检查你提供的内容。
复查报告复制修复建议,更新 robots.txt 或 sitemap 生成逻辑,然后用修正后的内容再次运行 Robots 和 Sitemap 检查器。
网站迁移时,建议分别检查生产 robots.txt 和每个生成的 sitemap 文件,再切换流量。
重新检查关于输入内容、隐私、限制、官方 sitemap 规则、robots.txt 解读,以及 Robots 和 Sitemap 检查器不会抓取哪些内容。
你可以粘贴原始 robots.txt、sitemap.xml 或 sitemap index 内容。Robots 和 Sitemap 检查器会根据内容识别类型,并运行对应检查。它不是域名查询工具。
不会。Robots 和 Sitemap 检查器只在浏览器里检查粘贴或上传的内容。它不会请求 /robots.txt、抓取页面、提交 sitemap 或验证服务器响应。
它会检查 User-agent 分组、Allow 和 Disallow 规则、Sitemap 指令、Crawl-delay、空规则、重复规则、无效行,以及 User-agent: * 搭配 Disallow: / 这个高风险模式。
它会检查 XML 是否可解析、根元素是否为 urlset 或 sitemapindex、loc 是否为空或无效、URL 是否重复、lastmod 是否异常,以及条目数量是否超过 50,000。
不能。Robots 和 Sitemap 检查器能发现常见内容级问题,但搜索引擎行为还取决于实时服务器访问、重定向、HTTP 状态、canonical、页面质量和爬虫自身规则。
是的。检查在当前浏览器标签页运行,文件内容不需要离开你的设备。不过 robots.txt 和 sitemap 通常是公开文件,仍然不要把密钥或私密信息放进去。
粘贴抓取文件,复查报告,复制建议,并在上线前重新检查修正后的 robots.txt 或 sitemap.xml。
仅做浏览器本地检查;不抓取域名,也不实时请求 URL。