上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能正常访问页面、页面返回的是可索引内容、站点没有用错误指令把整站或关键页面挡在门外。时间和人手有限时,优先检查 robots.txt、meta robots、canonical、状态码、sitemap 和主要入口链接,这几项覆盖了绝大多数上线即被挡的问题。
只要网站换了域名、改了目录结构、从测试环境迁到正式环境,或者上线前做过“禁止抓取”的临时设置,就必须核对。反之,如果只是页面内文字微调、模板结构没动,可以只抽查关键页,不必全站逐条过。
判断顺序建议从“整站级”到“单页级”:整站级配置一旦出错,影响的是全部页面,修复成本也最低;单页级问题数量多但影响面小,可以放到后面处理。
最常见的上线事故是测试期间在 robots.txt 里写了全站禁止抓取,上线后忘记删除。核对时直接访问域名下的 /robots.txt,逐行确认:
Disallow: / 这类全站屏蔽规则;/css/、/js/、/images/ 等资源目录,导致页面能抓但渲染不全;验收信号:robots.txt 返回 200 状态码,内容为纯文本,没有屏蔽正式内容目录。如果站点有多个子域或测试域名,要分别确认,不能只看主域。
模板或 CMS 常带有全局 meta robots 设置,上线时可能仍是 noindex,nofollow。检查方法是查看页面源代码中的 <meta name="robots">,确认没有 noindex。同时注意 X-Robots-Tag 响应头,它同样能阻止索引,且容易被忽略。
canonical 标签用于指明首选版本。核对时看两点:一是 canonical 指向的地址是否与当前页面一致、是否为可访问的正式地址;二是全站是否误把所有页面都指向首页。后者会导致内页不被当作独立页面处理。
判断结果:如果 canonical 指向 404 页面或测试域名,应视为配置错误,优先修复。
抓取的前提是页面能被稳定访问。抽查首页、栏目页和若干内容页,确认返回 200,而不是 301 链路过长、302 临时跳转或 404。对改版站点,尤其要确认旧地址跳转到新地址,而不是跳到首页。
入口链接决定抓取路径。检查导航、面包屑和列表页是否使用可抓取的 <a href> 链接,而不是仅靠 JavaScript 点击事件。sitemap 则作为补充,核对其中列出的地址是否全部为 200 状态、是否包含 noindex 页面。
验收信号:从首页出发,通过链接能在少数几次点击内到达主要栏目和代表性内容页;sitemap 中的地址抽样访问均正常。
/robots.txt,排除全站屏蔽;这套顺序大约十几分钟即可完成,能覆盖上线前最容易造成“整站不被收录”的配置问题。完成后,下一步是在正式环境提交 sitemap,并在后续几天观察抓取与索引状态是否随访问量正常增长。