百度收录查询 - 短横线识别配置冲突的可执行清单

📍 WDQWDWQD987AAAAA:216.73.216.20
📱 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
🔗 /2223d4a05673.html
📄

百度收录查询 - 短横线识别配置冲突的可执行清单

百度收录查询出现异常时,配置互相冲突往往不是单一文件写错,而是多个入口对同一批 URL 给出了相反信号。要识别冲突,最可靠的做法是把 robots.txt、页面 meta 标签、HTTP 响应头、站点地图和站内链接指向逐项拉出来对比,看同一 URL 是否在不同位置得到“允许抓取”和“禁止抓取”两种结论。下面是一份按顺序执行的清单,每项都说明查什么、怎么查、结果说明什么。

先固定一个待查 URL 样本

不要一上来就查全站。先从百度收录查询结果里挑 3 到 5 个状态不一致的 URL:有的被收录、有的没被收录、有的收录后又消失。把它们记在表格里,后续所有检查都围绕这几条 URL 展开。如果样本本身在站内已经 404 或跳转多次,先排除链接失效问题,再谈配置冲突。

检查 robots.txt 与页面 meta 是否互相矛盾

要查的是:robots.txt 里是否对某目录写了 Disallow,而该目录下的页面 meta 却写着 index,follow;或者反过来,robots.txt 允许抓取,页面却写了 noindex。

怎么查:直接访问 /robots.txt,找到匹配样本 URL 的规则;再查看该页面的 <meta name="robots"> 内容。注意百度对 noindex 的处理依赖抓取,如果 robots.txt 已经禁止抓取,爬虫可能读不到 noindex,导致页面长期留在索引里。

结果说明什么:两者方向相反就是明确冲突。此时不要用 robots.txt 当作移除索引的手段,它只限制抓取,不等于可靠的索引移除;真正要阻止收录,应让页面可被抓取并返回 noindex,或对已收录 URL 使用百度搜索资源平台提供的移除工具(以平台当前实际功能为准)。

对比 HTTP 响应头与页面内标签

要查的是:X-Robots-Tag 响应头是否与页面 meta 或 robots.txt 冲突。例如响应头写了 noindex,页面 meta 却写 index。

怎么查:用命令行 curl -I 你的URL 查看响应头,重点看 X-Robots-Tag、状态码和 Location。如果状态码是 301 或 302,要确认最终落地页是否又回到了被禁止的路径,形成跳转循环。

结果说明什么:响应头优先级通常高于页面 meta,两者不一致时以更严格的一方为准。若响应头来自 CDN 或服务器全局配置,而 meta 是模板单独写的,说明冲突源头在服务器层与模板层之间,需要统一到一处管理。

核对站点地图与站内链接的信号

要查的是:站点地图里列出的 URL,是否正好是 robots.txt 禁止抓取或页面写了 noindex 的 URL;站内导航和正文链接是否大量指向这些 URL。

怎么查:下载 sitemap,抽取样本 URL 做匹配;再用 site:你的域名 结合百度收录查询观察这些 URL 的收录状态。注意站点地图不保证收录,它只是提交线索,不能替代可抓取和可索引条件。

结果说明什么:如果 sitemap 主动提交的 URL 同时被 robots.txt 屏蔽,说明提交与抓取配置互相打架。站内链接持续指向 noindex 页面,也会让爬虫反复抓取却无法收录,属于典型的内部信号冲突。

用一张表判断冲突归属

把样本 URL 按下面四列填好:robots.txt 结论、meta 结论、响应头结论、sitemap 是否包含。只要同一行出现“允许”和“禁止”并存,就标记为冲突。全部为“允许”却仍未被收录,则冲突可能不在抓取层,而要看内容质量、重复度和外链情况,不能继续在配置里绕圈。

适用条件:这套方法适合页面数量可控、能逐条取证的站点。如果站点有几十万 URL,先按目录抽样,再定位到产生冲突的模板或服务器规则,而不是逐页修改。判断结果以实际抓取到的文件内容为准,不要凭记忆或后台开关推断。

下一步:把标记为冲突的 URL 按“robots.txt、meta、响应头、sitemap”四列整理成一份清单,先统一同一目录下的规则来源,再重新提交并观察百度收录查询结果的变化。

图1 图2

nginx