检查网站收录前,至少要准备好四类信息:可访问的域名与协议版本、要检查的具体页面清单、robots.txt 与站点地图的当前内容、以及能证明抓取和索引状态的记录。缺少其中任何一项,后面的判断都容易变成猜测。第一次接触这个问题时,不必先学完整套 SEO 理论,先把这四类材料凑齐,再决定下一步查什么。
收录检查的第一步不是打开工具,而是写清楚你到底要查什么。同一个站点可能同时存在 HTTP 和 HTTPS、带 www 和不带 www 的版本,它们对搜索引擎来说是不同地址。你需要先确认当前对外使用的规范版本,并把它记录下来。
页面清单则决定了检查范围。可以按下面的顺序整理:
清单不需要一次列全站。第一次检查时,选 10 到 30 个代表性地址即可。判断标准很简单:如果这些地址的状态都说不清,扩大到全站只会让问题更乱。
这三项是收录检查中最常被引用的材料,但它们的含义需要分清。
robots.txt 记录的是抓取限制。它告诉爬虫哪些路径不建议抓取,但它不是可靠的索引移除手段。一个页面被 robots.txt 禁止抓取,不等于它一定不会出现在搜索结果里;反过来,robots.txt 没有限制,也不代表页面就会被收录。检查前先把当前 robots.txt 的完整内容保存下来,注意其中是否有 Disallow 规则误伤了你要查的目录。
站点地图 是一份候选地址列表。提交站点地图可以帮助搜索引擎发现地址,但不保证收录。准备时要确认:站点地图里的地址是否都是规范版本、是否返回正常状态、是否包含了你清单里的页面。如果站点地图里混入了大量跳转或错误地址,它作为检查依据的价值就会下降。
页面自身状态 包括三件事:能否正常打开、返回的状态码是什么、页面是否带有禁止索引的标记。检查时逐项记录,不要只看“能打开”就下结论。一个页面能打开但返回异常状态码,或者带有 noindex 标记,收录结果会完全不同。
检查收录时最容易犯的错误,是把一个现象直接当成原因。比如“页面没被收录”可能由多种情况造成:地址从未被发现、被抓取但未索引、被规则阻止、或者内容与已有页面高度重复。这些解释对应不同的处理方式,不能混为一谈。
因此你需要准备一份记录,至少包含:
noindex 或 canonical 指向其他地址;把这些信息并排放,才能判断问题出在哪一层。例如:robots.txt 允许抓取、页面返回正常、没有 noindex,但长期没有抓取记录,这时更值得查的是地址是否被外部链接或站点地图有效暴露;如果页面带有 noindex,那原因已经定位,不需要再猜抓取问题。
需要提醒的是,不同搜索引擎对 robots.txt 规则、站点地图格式和索引标记的支持情况并不完全一致。如果你关心的是多个搜索引擎的表现,要分别核查,不能用一个平台的结果直接推断另一个。
信息准备好之后,下一步是按代价从低到高排查。先做不需要改动网站的事,再做需要改动的事。
如果检查目的是确认新页面是否进入索引,优先做零代价和低代价两项;如果发现页面被规则阻止,再进入改动环节。适用条件是:你已经能说清每个待查地址的当前状态。判断结果是:原因明确时直接处理,原因不明确时先补充记录,不要急着改配置。
下一步可以从你的页面清单里挑一个地址,完整走一遍上面的记录流程:写下协议与域名版本、状态码、robots.txt 是否允许、是否有 noindex、是否在站点地图中。走完这一遍,你就有了继续排查其他地址的模板。