排查重复页面时,先判断它是否真的在争抢同一批搜索需求,再决定处理顺序。时间和人手有限的情况下,优先处理“内容几乎相同、都在被搜索流量触达、且有明确主版本”的重复页;只是参数不同或列表分页造成的相似页,通常可以往后放。下面用一个假设例子说明步骤。
假设一个站点介绍“旧房翻新预算”,存在三个页面:/budget、/budget-2024、/budget-city。标题接近,正文主体都讲预算构成,只有少量城市举例不同。搜索时可能三个页面轮流出现,也可能只有其中一个获得点击。这里的核心不是“页面多”,而是它们是否在回答同一搜索意图,以及站内是否明确指定了主版本。
排查时先做一张表,列出每个页面的URL、标题、首屏核心结论、主要关键词、内链指向、最近改动时间。不要凭印象判断重复,先看实际内容。
常见重复来源有几类,处理方式不同:
这里容易犯的错误是:看到重复就批量删除。若某个重复页已有外部链接或稳定点击,直接删除可能损失可达路径。更稳妥的做法是先判断主版本,再决定保留、合并或设置规范指向。
对每个候选页面逐项检查:
判断结果通常有三类:A页明显是主版本;A、B各有独立价值;无法判断。前两类可继续处理,第三类先保留并补充差异化内容,不要急着合并。
时间和人手有限时,建议顺序如下:
假设例子中,如果/budget内链最多、内容最全,可先把它定为主版本;把/budget-2024和/budget-city中有用的年份差异、城市差异并入,再让旧URL指向主版本。若/budget-city确实服务不同城市需求,且内容差异足够,就保留为独立页,而不是强行合并。
不要用一次改动前后的单日数据下结论。比较时至少考虑季节变化、搜索需求波动和数据采集差异。可观察:主版本是否获得更多站内入口;重复页是否仍频繁出现在搜索结果;同一查询下展示的URL是否趋于集中。若重复页仍被大量引用,继续查内链和外部链接,而不是反复改标题。
常见错误还包括:只改标题不改正文,导致两个页面仍回答同一问题;把规范指向设到无关页面;合并后没有更新旧页入口,用户仍能点到旧内容。排查时逐项核对,比一次性大改更容易定位问题。
下一步可以选一个内容最接近的重复组,按“列页面—定主版本—改内链—再合并”的顺序处理,观察站内入口和搜索展示是否集中,再决定是否扩大到下一组。