抓取、索引和排名是三个先后不同、失败原因也不同的环节。区分它们最实用的方法,是先用一条可核对的查询判断页面有没有被抓取,再判断有没有进入索引,最后才看它有没有排名。时间有限时,先处理“没被抓取”和“没被索引”,因为排名优化对这两类页面基本无效。
很多人发现页面搜不到,第一反应是排名被压了,于是去改标题、堆内容、加外链。但如果页面根本没被抓取,或者被抓取后没有进入索引,排名环节还没有开始。此时做排名优化,等于在没开门的地方排队。
三个环节的先后关系可以这样理解:
抓取失败、索引失败、排名靠后,都会表现为“搜不到”,但处理方式完全不同。
最直接的检查项是站内查询。在搜索框输入 site:你的域名,再逐步缩小到具体目录或具体 URL。如果目标页面出现在结果里,说明它至少已经进入索引,问题更可能在排名或匹配度;如果整站或某个目录都查不到,优先排查抓取和索引。
这里要注意两点判断条件:
如果站内查询查不到,下一步不要猜,去看服务器访问日志或搜索引擎提供的抓取统计。日志里能看到爬虫是否请求过该 URL、返回的状态码是什么。若日志里完全没有该 URL 的请求记录,说明抓取这一环可能还没发生;若请求了但返回 404、403、500 或跳转到其他地址,说明抓取被阻断或拿不到有效内容。
抓取成功不等于一定被索引。常见原因包括:页面内容与站内其他页面高度重复、页面几乎没有独立信息、返回了禁止索引的标记、被规范标签指向了别的 URL、页面需要登录才能看到主体内容。这些情况属于“已经定位或可排查的原因”,不是唯一解释,需要逐项核对。
可执行的检查顺序如下:
<meta name="robots" content="noindex">,有则说明页面被明确要求不索引。<link rel="canonical"> 指向了另一个 URL,若有,搜索引擎可能把权重和收录归到目标 URL。如果以上检查都正常,但页面长期未收录,可以提交 URL 请求抓取,并补充来自站内其他页面的链接,让爬虫有路径到达。是否收录、多久收录由搜索引擎决定,不能保证固定时间。
确认页面已被索引后,搜不到目标词通常属于排名问题。这时要区分搜索场景:网页搜索、平台站内推荐和付费广告的展示逻辑不同,不能用广告位出现与否判断自然排名。
排名环节可检查的方向包括:
假设一个页面已经能被 site: 查到,但搜“刑天seo”相关主题时排在很后面,那么它是排名问题,不是抓取或索引问题。此时改 robots 标记、反复提交抓取,通常不会带来排名改善。
按环节倒推,先做成本最低、阻塞最严重的事:
判断结果的标准很简单:抓取问题看日志和状态码,索引问题看站内查询和页面标记,排名问题看已索引页面在目标词下的表现。三者不要混在一起改。
下一步,挑一个你确认重要的 URL,先做站内查询,再对照日志看它最近一次被抓取的状态码,把结论写成“未抓取”“已抓取未索引”或“已索引排名低”中的一项,再按对应环节处理。