排查重复页面,核心是先把“内容相同或高度相似、但URL不同”的页面找全,再判断哪些是技术性重复、哪些是内容策略造成的重复,最后按优先级处理。多人协作时,建议把排查结果写成一张表:URL、重复类型、判断依据、处理动作、负责人、验收信号。这样交付清楚,也能减少返工。
重复页面不一定是一字不差。以下情况都可能被归入重复:
判断时要看“主要内容是否相同”,而不是只看标题。适用条件是:页面能被访问、能被链接到、可能被搜索引擎发现。如果页面本身有登录限制或robots屏蔽,处理优先级可以降低,但仍要记录。
导出网站主要入口链接、导航链接、站点地图中的URL,形成基础清单。多人协作时,让负责不同栏目的人分别补充自己维护的页面,避免只依赖一个人抓取。
用站内搜索搜正文中的独特句子,看是否出现多个结果。也可以用支持抓取的命令行工具或爬虫工具,把页面标题、正文摘要、状态码、规范链接列出来。假设一个例子:某篇文章的正文第一句是“本指南说明退货流程”,站内搜索返回三个URL,其中两个正文相同,一个只是列表页摘要,这就值得进一步核对。
把标题和正文去掉导航、页脚、广告后,计算相似度或提取正文指纹。相似度高的URL放在同一组。不要只凭URL规则判断,因为参数不同的URL可能内容不同,而路径不同的URL也可能内容相同。
常见判断与处理如下:
优先级建议:先处理被站内链接指向、能被抓取、且内容完全相同的URL;再处理参数和筛选造成的相似页面;最后处理历史遗留的低价值页面。
把排查表作为交付物,字段至少包括:URL、重复分组编号、重复类型、判断依据、处理动作、负责人、完成日期、验收信号。验收信号要可检查,例如:
改动前后比较时,要考虑季节、搜索需求变化和数据采集差异,不要用一次改动前后的排名波动直接断定因果。可以固定一个检查周期,分别记录抓取数量、重复分组数量和主URL访问情况。
先选一个栏目做小范围排查:导出该栏目URL,按正文相似度分组,挑出完全相同的组,确定主URL并执行301,然后更新站内链接和站点地图。完成后再把同一张表复制到下一个栏目,逐步扩大范围。