上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能正常抓到页面、抓到的页面允许被索引、最终展示的规范网址符合你的预期。建站风格选择会影响这项工作的难度:静态页面和轻量服务端渲染的站点,抓取配置往往更直观;依赖大量客户端渲染或复杂路由的站点,则需要额外验证渲染结果和路由规则。核对的代价主要是时间——一个中等规模的站点,完整走一遍通常需要半天到一天。
这两类配置解决的是不同问题,核对时不要混在一起看。
robots.txt、站点地图、内链结构、服务器响应状态。meta robots、X-Robots-Tag、canonical、重定向规则。一个页面被抓取成功,不等于会被索引;被索引,也不等于会获得排名。核对的目标是排除明确的阻断项,而不是预测结果。
robots.txt,确认没有误写 Disallow: / 这类全站屏蔽规则。测试环境遗留的屏蔽规则是上线后最常见的问题之一。<head> 中的 meta robots,确认没有意外的 noindex。这类标签常因模板复制或环境判断写错而残留。X-Robots-Tag。它和页面内的 meta 标签作用类似,但更容易被忽略,尤其是图片、PDF 等非 HTML 资源。canonical 指向的地址应当是 200 状态、与当前页内容一致,并且是绝对地址。建站风格选择直接决定上面哪些项目需要额外投入。
判断依据很简单:如果你的页面内容需要执行 JavaScript 才能出现,就必须多花一步验证渲染结果;如果内容直接在 HTML 里,这一步可以省略。
假设你有一个约 50 个页面的企业站,上线前一天按下面顺序走一遍:
/robots.txt 和 /sitemap.xml,确认都能打开且内容正确。noindex 和 canonical,逐条确认。这套顺序的代价是半天左右,收益是避免上线后因一条错误规则导致整站不被收录,而排查这种问题往往要花更久。
如果某个页面没有被索引,可能原因有多个:被 noindex 屏蔽、被 robots.txt 拦截、规范网址指向了别的页面、内容与已有页面高度重复,或者只是尚未被抓取。不要凭单一现象下结论,按“先看响应状态、再看 robots 规则、再看页面级标签、最后看规范网址”的顺序逐层排除,才能定位到具体那一项。
下一步:把上面的清单整理成一份上线检查表,在每次发布前固定执行一遍,并把结果存档,方便下次对比。