上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能抓到页面、抓到的页面允许被索引、最终展示的地址与内容符合预期。建议在正式切换域名或开放访问前,用可重复的清单逐项检查,把“可能原因”和“已定位原因”分开记录,避免上线后再回头排查。
要查的是:robots.txt 是否误屏蔽、服务器是否返回正常状态码、页面是否需要登录才能访问。
https://你的域名/robots.txt,看是否出现 Disallow: / 这类全局屏蔽规则;再用浏览器无痕模式打开几个代表性页面,观察是否被强制跳转到登录页。robots.txt 屏蔽了整站,抓取会被拒绝,此时先改规则再谈索引;如果页面返回 403 或 401,说明抓取通道本身不通,需要先解决访问权限。要查的是:页面是否输出了 noindex、规范链接是否指向自己、分页与筛选参数是否产生大量重复地址。
<meta name="robots">,确认没有 noindex 或 nofollow 误用。<link rel="canonical"> 指向的地址是否与当前页面一致;若指向其他页面,说明该页可能不会被单独索引。robots.txt 规则收敛,避免同一内容生成多个可抓取地址。判断结果:规范链接指向自己且无 noindex,说明该页具备被索引的基本条件;若规范链接指向别的地址,则应把它当作“已定位的重复内容处理项”,而不是继续等待收录。
要查的是:首页到重要内页是否只需少量点击、导航与内链是否使用可抓取的 <a> 链接、是否有孤立页面。
要查的是:sitemap.xml 中列出的地址是否都能返回 200、是否包含已被屏蔽或已删除的页面。
可执行步骤:抽取站点地图中的若干条地址,逐条访问并记录状态码。若出现 404、301 或 403,说明站点地图与实际可访问地址不一致,应先修正再提交。适用条件:站点地图用于辅助发现地址,但它不能替代抓取通道和索引规则检查;即使地图完整,若页面被 noindex 标记,仍不会被索引。
如果是从测试环境切换到正式域名,先选 3 到 5 个代表性页面做验证:确认新域名可访问、旧地址是否正确跳转、页面源码中的规范链接是否已换成新域名。假设某页面仍保留测试域名的规范链接,抓取工具可能把它视为重复地址,此时应统一替换后再开放抓取。验证通过后,再逐步放开全站访问,并保留一份检查记录,便于后续对照。
下一步:把上述清单整理成上线前检查表,每项标注“已通过、待修复、需复查”,并在正式开放抓取后定期抽查状态码与索引状态。