重复页面排查的目标,是找出内容高度相同或高度相似、却存在多个可访问地址的页面,并判断哪一个应作为主要版本保留。交接或验收时,不能只看“有没有重复”,而要留下可复核的记录:每个疑似重复的URL、判断依据、处理动作和复查结果。下面用一个假设例子说明操作步骤与常见错误。
假设某站点有一篇介绍“旧房翻新预算”的文章,地址为/budget/laofang。后来编辑又发布了一篇内容基本相同的文章,地址为/news/2024/budget-laofang,同时列表页还带参数?from=list。此时至少有三个地址可能返回同一篇内容。排查时先把它们放进同一张表,而不是立刻删除或跳转。
表中至少记录:完整URL、页面标题、正文首段、返回状态码、canonical标签指向、是否有站内链接、是否被sitemap收录。若某地址返回200且正文与主版本几乎一致,就列为疑似重复;若返回301或404,则不属于当前重复页面,但仍要记录处理状态。
site:查询分别找出同一主题的多个地址。前者看站内是否重复发布,后者看外部可发现版本。这套步骤适用于准备交接或验收的场景,因为每一步都能留下可检查的结果。若站点规模较大,可以先按栏目抽样,再扩大到全站;不要在没有记录的情况下批量删除,否则后续无法判断哪些地址曾经存在。
常见错误之一,是把所有带参数的URL都当成重复页面。参数可能用于筛选、排序或分页,内容并不完全相同。判断依据应是正文主体是否高度一致,而不是URL里有没有问号。
常见错误之二,是只看canonical标签就下结论。canonical是提示,不是强制指令;如果两个地址都能访问、都有内链,仍可能被分别抓取。验收时要同时检查标签、状态码、内链和sitemap,而不是只看其中一项。
常见错误之三,是忽略分页和打印页。分页地址若每页展示不同内容,通常不属于重复;打印页若与正文页内容一致,则应按重复页面处理。把这两类混在一起,会导致误删或漏处理。
比较改动前后数据时,要考虑季节、搜索需求变化和数据采集差异,不能把一次抓取结果直接当成固定结论。验收标准应是“处理动作可复核、状态码符合预期、主要版本可访问”,而不是承诺某个时间点一定出现某种排名变化。
先选一个栏目,按上面的表格抓取10到20个地址,完成一轮疑似重复清单和处理记录。把这份记录作为交接附件,下一次复查时只需对照状态码、canonical和内链三项,就能判断重复页面是否已经处理到位。