重复页面排查的核心不是先改标签,而是先找出内容高度相同或高度相似的URL,再判断它们是被动产生的参数页、分页、打印页,还是主动保留的多版本页面,最后决定用301、canonical还是noindex处理。排查顺序建议是:先抓取全站URL,再按标题、正文指纹和参数分组,最后逐组确认保留哪个版本。
重复页面不等于完全一样的文字。下面几种情况都应进入排查范围:
?from=、?utm_source=等跟踪参数。/news/a与/zt/a。判断依据是“用户看到的主体内容是否基本相同”,而不是URL是否长得像。标题不同但正文相同的页面,通常也算重复。
第一步,导出URL清单。可以从站点地图、站内链接抓取工具或服务器日志中获取,至少包含完整URL、状态码、页面标题、正文前若干字符。第二步,按标题和正文指纹分组。把标题去掉栏目名、页码、排序词后比较,再把正文去掉导航和页脚后取一段连续文本做指纹。第三步,人工抽查分组结果。工具给出的相似组要打开看,确认是模板重复还是内容确实相同。
一个可执行的检查项是:随机抽10组疑似重复URL,分别记录它们的标题、H1、正文首段和 canonical 标签。如果两组页面的标题和首段几乎一致,只是URL参数不同,就应优先处理参数版本。
处理前先确认哪个版本是希望被用户和搜索引擎使用的版本,再选方法:
canonical是提示而非强制指令,301是更强的信号。能合并的重复页面优先301;不能删除但又不想被单独收录的,再用canonical或noindex。noindex页面仍可能被抓取,不要指望它替代301。
处理完成后,先做技术验收:重复URL应返回301或带正确canonical,主版本应返回200且自指canonical。再做数据验收:在抓取工具中重新抓取相关分组,观察重复URL是否逐渐从索引中减少,主版本的展示和点击是否集中。比较前后数据时要考虑季节、搜索需求和采集差异,不能把一次波动直接当成改动效果。
如果两周后重复URL仍大量存在,先检查内链是否还指向旧版本、站点地图是否还提交旧URL、301是否链式跳转。这些是常见原因,但不一定是唯一原因,需要逐项核对。
从今天起,先导出全站URL并按标题分组,挑出重复数量最多的一组,确认主版本后执行301或canonical,再把内链和站点地图同步到主版本。完成一组再处理下一组,避免一次性全站改动导致无法判断问题来源。