排查重复页面,核心是找出“同一内容有多个可访问地址”的情况,再判断哪个地址应该作为主版本保留。常见重复来源包括参数版本、大小写变体、带与不带结尾斜杠、打印页、分页、筛选排序、HTTP与HTTPS或带www与不带www同时可访问。排查顺序建议先抓取、再比对、后处理,不要一上来就批量删除。
假设一个团队上线了产品列表页,开发为了方便测试,让以下地址都能打开同一批商品:/list、/list/、/list?page=1、/list?sort=price。运营在后台又生成了/list-2作为备用入口。三周后,搜索流量没有明显变化,但收录数量增加,标题和摘要互相竞争。这个例子里,重复不是“内容抄了别人”,而是站内同一内容有多个入口。
多人协作时,返工往往来自没有指定唯一负责人:开发认为运营会处理,运营认为开发会加规范标签。要减少返工,先建立一张“地址—内容—主版本—处理动作”的表格,再动手改。
不要只靠站点地图。站点地图通常只列主版本,重复页面往往藏在参数、筛选和旧链接里。可以执行以下检查:
/About与/about是否都返回200。判断结果:如果两个地址返回200且主要内容一致,就进入比对环节;如果其中一个返回301或404,通常不算重复页面问题,但要确认跳转目标是否正确。
把地址两两分组,比较标题、正文主体、商品或文章主体、分页内容。真重复指主体内容几乎相同,仅URL不同;近似重复指筛选页、分页页,内容部分重叠但各有独立用途。
常见错误是只看标题相同就判定重复。标题相同但正文不同的页面,不一定是重复页面;正文相同但标题不同的页面,反而更危险,因为用户和搜索引擎会看到两个竞争版本。
可以按以下优先级判断主版本:
如果无法确定,先保留一个,其余用301跳转到主版本。不要用JavaScript跳转代替服务器端跳转,也不要用robots.txt屏蔽,因为屏蔽后仍可能被索引,只是无法传递信号。
不同重复原因,处理方式不同:
适用条件:如果重复地址有独立搜索需求,例如“红色连衣裙”筛选页,直接删除可能损失流量;如果没有独立需求,只是技术变体,优先合并。
改动前先记录基线:收录数量、主要落地页、内部链接指向。改动后再观察,但不要用固定天数承诺见效。比较时要考虑季节、搜索需求变化和数据采集差异,例如节假日前后同一类目流量本身会波动。
交付清单可以包括:
常见错误是改完不复查,导致跳转链过长、规范标签指向404、或旧地址仍返回200。多人协作时,建议由一人统一更新表格,另一人抽查十个地址,确认跳转和规范标签实际生效。
下一步:先导出最近一个月的访问日志和抓取结果,按“返回200且内容相同”筛出第一批重复地址,再按上面的优先级确定主版本并分配处理人。