上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能正常访问页面、页面没有被错误地禁止抓取、可索引页面能进入索引流程。做法不是只看一个开关,而是按“抓取可达性—抓取规则—索引信号—上线后复查”逐项验证,并保留证据。
抓取是索引的前置条件。如果服务器拒绝、超时或返回异常状态,后续配置再正确也没有意义。上线前至少检查以下项目:
curl -I或浏览器开发者工具查看目标页返回状态,正常应为200;301/302要确认跳转终点是否正确。robots.txt能否直接访问,返回200且内容不是空白或错误页。判断结果时注意:返回200只说明服务器愿意响应,不代表页面一定被抓取。若日志里同一爬虫反复请求却始终拿不到完整内容,应优先排查超时、压缩或渲染问题。
抓取规则决定爬虫能看哪些路径。常见错误是测试站沿用“禁止全部抓取”的配置直接上线。检查时逐条对照:
robots.txt,确认没有针对User-agent: *的Disallow: /。<head>中是否误写了<meta name="robots" content="noindex">,尤其是从测试环境复制过来的模板。X-Robots-Tag: noindex,它和页面meta指令同样有效。这里要区分两种现象:页面能被抓取但被禁止索引,和页面根本不被抓取。前者在抓取日志中能看到请求记录,后者往往没有记录。定位方向不同,处理方式也不同。
抓取允许之后,还要让页面具备被索引的条件。上线前可执行以下检查:
<title>,避免全站标题相同。<link rel="canonical">指向首选地址。假设一个山西本地企业站有“产品列表”和“产品详情”两类页面,若列表页用参数生成多个排序版本,而每个版本都返回200且没有规范链接,就可能造成重复内容分散索引信号。此时应保留一个主列表地址,其余版本做规范化处理。这是假设示例,用于说明判断逻辑,不代表具体项目结果。
上线前配置正确,不等于上线后立即被索引。复查应关注可核对的事实,而不是猜测算法偏好:
site:加域名做粗略观察,但它只是参考,不能当作完整索引报告。复查时不要只盯首页。栏目页、详情页和分页的抓取与索引状态可能完全不同,应抽样检查每一类模板的代表页面,并记录检查时间与结果,便于对比处理前后的变化。
下一步:整理一份上线检查表,把状态码、robots规则、meta指令、规范链接和站点地图列为必查项,上线后按同一张表逐项复查并留存记录。