上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能正常抓取页面、页面没有被误设为不索引、站点结构能让人和爬虫都顺利到达每个重要页面。建议在正式切换域名或发布新版本前,用一份可勾选的清单完成准备、实施、验证和上线后维护,避免多人协作时遗漏配置、反复返工。
抓取与索引核对不是从工具开始,而是从页面清单开始。多人协作时,最容易出问题的是没人说得清哪些页面重要、哪些页面本就不该被收录。
www、是否使用 https、结尾是否带斜杠。判断标准很简单:如果某个页面删掉后会影响用户从搜索进入网站,它就应该在“需要索引”清单里;如果它只服务于登录用户或内部测试,就应放进“不应索引”清单。
抓取入口决定爬虫能否发现页面,索引指令决定页面被发现后是否允许收录。两者要分开检查,不能只看其中一个。
robots.txt 是否屏蔽了整站或关键目录,尤其是上线时误把测试环境的屏蔽规则带过来。<meta name="robots"> 是否误写了 noindex。X-Robots-Tag: noindex,这种设置不会显示在页面源码里,容易被忽略。rel="canonical" 指向唯一正式地址。这一步最关键的是把“抓取”和“索引”分开验证:robots.txt 允许抓取,不代表页面一定会被索引;页面没有 noindex,也不代表爬虫一定能顺利抓到。
上线前不要只靠肉眼查看页面。下面这些操作可以在本地或预发布环境执行,结果可交给同事复核。
noindex、canonical 和 robots,确认没有误写。https://你的域名/robots.txt,确认屏蔽规则符合预期。curl -I https://你的域名/,确认状态码和 X-Robots-Tag。如果页面返回 200 但抓取测试显示被屏蔽,优先检查 robots.txt 和响应头;如果页面能抓取但未被索引,再检查内容质量、重复地址和 noindex。不要看到“未收录”就直接断定是服务器问题,原因可能有多种。
上线不是终点。域名切换、栏目调整、模板改版都可能重新引入抓取或索引问题。建议在上线后一周内每天查看一次抓取错误和索引状态,之后改为每周检查。
判断维护是否有效的标准不是“立刻收录”,而是抓取错误没有增加、重要页面状态码稳定、正式地址没有互相冲突。若出现异常,先回退最近一次改动,再逐项验证。
下一步:把上面的检查项整理成一份上线前核对表,指定一名负责人逐项打勾,并在正式发布前让另一名同事复核 robots.txt、noindex 和 canonical 这三处最容易出错的配置。