改版或迁移时,核对搜索引擎抓取规则的目标不是让页面立刻被收录,而是确保旧地址、新地址、抓取入口和屏蔽规则之间不互相打架。最需要防的是两件事:该被发现的页面被 robots.txt 挡住,以及旧链接失效后没有可传递信号的跳转。多人协作时,把这两件事拆成可交付的检查项,比事后排查返工更省成本。
robots.txt 决定爬虫能不能抓某个路径,但它不是可靠的索引移除手段。如果页面已经被收录,只加一条 Disallow 通常不会让它从结果里消失,因为搜索引擎仍可能保留已有信息。改版时若把整站临时屏蔽,等上线后再放开,可能出现旧页面被逐步移除、新页面又还没被发现的空档。
可执行的核对步骤:
Disallow: / 这类全站规则是否被遗留。判断结果:如果关键路径被挡,抓取会受限;如果只是屏蔽了无价值参数页,影响通常可控。代价是放开屏蔽后仍要等爬虫重新访问,不能把“已放开”等同于“已恢复”。
迁移时,旧 URL 到新 URL 的对应关系是核心交付物。优先使用 301 永久跳转,把旧地址指向最相关的新地址,而不是全部甩到首页。全部跳首页会让搜索引擎难以判断新页面主题,用户也会多走一步。
协作时建议用一张映射表交付,至少包含旧地址、新地址、跳转类型、负责人、验证结果。核对项包括:
适用条件:页面级迁移适合逐条映射;整站换域名时,可先用规则覆盖大部分路径,再对重点页面单独核对。判断结果:返回 301 且一步到达新页面,通常比 404 更有利于信号传递;但跳转本身不保证排名,只是减少损失。
站点地图能列出希望被发现的地址,但不保证收录。改版后应更新站点地图,去掉已删除的旧地址,加入新的规范地址。同时检查站内链接是否还指向旧地址,因为内链是爬虫发现新页面的重要路径。
可执行的检查:随机抽取若干新页面,确认能从首页或分类页通过普通链接到达;再抽查旧页面,确认没有大面积指向 404。若站点地图里混入大量失效地址,会浪费抓取预算,也会让协作方难以判断哪些页面真正需要处理。
迁移到 HTTPS 是常见动作,但 HTTPS 不保证安全无漏洞,也不保证排名。它解决的是传输加密问题,不等于页面内容可信或站点没有其他风险。核对时应确认证书有效、混合内容已清理、HTTP 地址能正确跳转到 HTTPS,而不是把 HTTPS 当成改版后的万能护身符。
同时检查规范标签:同一内容如果有多个地址,应通过 rel="canonical" 指向首选地址。改版后若规范标签仍指向旧地址,可能让搜索引擎继续把旧地址当作规范版本。判断方法:打开新页面源代码,确认规范地址是当前新地址;若仍为旧地址,应列入修复清单。
为了减少返工,建议按以下顺序推进,每一步都有可验证的产出:
代价比较:逐条映射更费人力,但适合页面数量有限、旧链接价值高的站点;规则批量跳转更快,但需要额外抽查重点页面,防止规则误伤。选择依据是旧地址的数量、是否有参数、以及团队能投入的核对时间。
下一步:把上述检查项做成一张上线前核对表,指定每项的负责人和验证方式,上线后按同一张表复查一遍,而不是等流量下降后再回头找原因。