上线前核对抓取与索引配置,目标是确认三件事:搜索引擎能抓到页面、抓到的页面允许被索引、索引后看到的是正确版本。交接或验收时不要只看“首页能打开”,而应逐项检查robots.txt、页面meta robots、canonical、sitemap和服务器响应,并把结果记录成可复查的清单。
抓取是索引的前置条件。若robots.txt误屏蔽全站,或服务器对搜索引擎返回异常状态,页面再完整也不会进入索引。
/robots.txt,确认没有Disallow: /这类全站屏蔽;若屏蔽了后台或测试目录,确认没有连带屏蔽正式内容目录。curl -I https://你的域名/,正常应返回200;批量检查栏目页和详情页,避免只有首页正常。判断结果:robots.txt允许抓取、目标页面返回200,说明抓取通道基本通畅。若返回301,要确认跳转终点是正式页面;若返回403或503,先解决服务器或防护规则问题,再谈索引。
页面能被抓取,不等于允许被索引。验收时要查看HTML源码中的<meta name="robots">和<link rel="canonical">。
noindex;若模板里带有noindex,nofollow,属于明显阻断。适用条件:内容页、栏目页通常需要被索引;后台、搜索结果页、重复筛选组合通常不需要。判断结果:源码中无noindex、canonical自指或指向正确规范地址,才算通过。
sitemap不是收录保证,但它是提交正式地址、发现遗漏的实用工具。验收时打开/sitemap.xml,检查其中列出的URL是否都能返回200,是否包含已下线或测试页面。
这一步的价值在于发现“页面存在但没被提交”或“提交了但打不开”两类问题。假设某详情页在sitemap中,但访问返回404,就应先修复链接或移除该条记录,而不是反复提交。
修改robots.txt、meta robots或canonical后,不要只凭记忆确认。建议在交接文档中记录:检查时间、检查URL、原始状态、修改内容、复查结果。复查时重新抓取源码和响应头,确认修改已经生效,而不是只改了模板缓存未更新。
如果使用搜索资源平台的抓取测试或网址检查工具,把它当作辅助验证,不要把它当成收录或排名承诺。不同搜索引擎处理速度不同,验收标准应落在“配置正确、页面可访问、允许索引”这些可核实项上。
下一步:按上述清单逐项填写验收表,把未通过项标出责任人和复查时间,再安排一次上线后复查。