上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能抓到页面、抓到的页面允许被索引、最终被索引的地址是你希望用户看到的那一个。具体做法有两条路线:一是只做基础放行,靠搜索引擎自行发现;二是主动提交并逐项验证。选择哪条,取决于站点规模、页面生成方式和是否已有旧站需要迁移。
把上线目标写成可验收的结果,核对才有落点:
这四项对应四类资料:域名与解析记录、页面地址规则、robots 文件、站点地图。缺少任何一项,核对都会停在半路。
方案一:基础放行。适合页面数量少、结构简单、没有历史包袱的新站。做法是确认 robots.txt 没有误封整站,页面没有输出禁止索引的标记,然后提交站点地图等待抓取。
方案二:主动提交加逐项验证。适合页面量大、由程序批量生成、或从旧域名旧目录迁移的站点。除基础放行外,还要逐类页面抽样检查,用抓取工具模拟访问,确认返回内容与预期一致。
判断依据可以按下面三点走:页面总数在几十个以内且无迁移,方案一通常够用;页面成百上千或由模板批量产出,优先方案二;存在旧地址需要跳转时,必须用方案二,因为跳转链一旦出错,方案一无法暴露问题。
以下检查项与顺序无关,但每一项都要有明确结论,不能只凭印象:
robots.txt,确认没有 Disallow: / 这类整站封禁;如果确实要屏蔽某些目录,确认路径写法与实际目录一致。举例说明:假设某站点上线时 robots.txt 写成了屏蔽整个目录,那么无论站点地图提交多少次,抓取都会被挡在门外。这个例子只用于说明检查顺序,不代表任何真实项目结果。判断方法是先看 robots 是否放行,再看页面是否允许索引,最后才看提交是否成功,顺序颠倒会浪费排查时间。
上线前的核对需要有人对结果负责。可以按下面的方式分工:
验收标准要写成可观察的现象,例如“正式地址返回正常状态”“站点地图可被外部读取”“抽样页面标题与正文非空”。不要写成“优化完成”这类无法判断的表述。
配置核对完成并不等于收录完成。上线后应定期查看抓取记录,确认搜索引擎访问的是正式地址而非测试地址;如果发现抓取量集中在无关页面,回到 robots 与站点地图检查放行范围,再决定是否调整。