要区分抓取、索引和排名,最可靠的办法是按顺序取证:先确认搜索引擎是否来过页面(抓取),再确认页面是否进入可检索库(索引),最后才检查特定查询下是否出现(排名)。三个环节任何一步失败,后面的结果都无从谈起。下面用一份假设的搜索引擎营销案例说明操作流程。
抓取是搜索引擎爬虫请求你页面的过程,它只说明“来过”,不代表“收录”。判断抓取是否发生,可以查服务器访问日志,筛选常见爬虫的 User-Agent,观察目标 URL 的响应状态码。200 表示正常返回,301/302 表示跳转,403/404/5xx 表示被拒绝或出错。若日志里根本没有该 URL 的请求记录,问题在抓取层,可能是内部链接缺失、robots.txt 屏蔽、服务器响应过慢。
检查项:
判断结果:日志有请求且返回 200,说明抓取正常,继续看索引;日志无请求或持续 5xx,先解决抓取,不要急着改标题。
索引是搜索引擎把抓取到的内容分析、存储并纳入可检索库的过程。抓取成功不等于索引成功,页面可能因质量低、重复、被 noindex 标记而不被收录。
可执行步骤:
site: 加具体 URL 查询,看该页面是否出现在结果中;<meta name="robots" content="noindex">;判断结果:site: 查询能返回该 URL,说明已索引;查不到但日志有抓取,多半卡在索引层,需排查 noindex、canonical 和内容质量。注意 site: 只是粗略核对手段,不同搜索引擎的返回口径并不一致。
排名是已索引页面针对某个查询出现在结果列表中的位置。它必须建立在抓取和索引都通过的基础上。如果页面还没被索引,讨论排名没有意义。
检查方法:用目标查询词搜索,观察该 URL 是否出现、大致在第几页。排名会随查询词、地区、设备、个性化历史变化,单次观察只能作为参考,不能当作稳定结论。
假设示例:某产品页日志显示爬虫每周访问、site: 可查到该 URL,但搜“产品名+价格”时首页找不到它。此时可判断抓取和索引基本正常,问题在排名层,应检查该查询下的竞争页面、标题与正文是否匹配搜索意图,而不是去改 robots.txt。
常见的误判是把排名问题当成索引问题,或把索引问题当成抓取问题。正确顺序是:日志确认抓取 → 收录检查确认索引 → 查询确认排名。每一步用证据说话,前一步不通过就不要跳到后一步。
复查时记录同一 URL 在三个环节的状态变化:日志是否持续有请求、site: 查询是否稳定返回、目标查询下是否出现。若某一步从通过变为不通过,优先排查最近的改动,例如 robots.txt、noindex、canonical、服务器配置或内容替换。
下一步:挑一个你关心的 URL,先导出近七天含该 URL 的服务器日志,再执行一次 site: 查询,把两个结果并排记录,就能明确当前卡在哪一层。