判断采集是否遗漏,不能只看抓取量或索引量,而要把“页面应该被发现的路径”和“实际被抓取、可索引的URL”做对照。核心方法是:先列出站点中所有可到达的URL,再与搜索引擎返回的已收录或已抓取结果比对,差集就是疑似遗漏项。多人协作时,应把这份差集作为交付物,标注每条URL的来源、状态和责任人,避免口头判断造成返工。
假设某站点有商品列表页、分页和详情页,团队只提交了首页和分类页到站点地图。诊断时按以下顺序执行:
这个例子的关键不是得到某个固定数值,而是形成可复核的证据链。如果只看到“收录量比预期少”,无法定位是链接问题、状态码问题还是索引策略问题。
第三方估算流量、搜索引擎报告和站内统计的口径不同。收录量下降不等于采集遗漏,可能是页面被合并、重复内容被过滤,或索引状态变化。判断时应优先核对以下检查项:
robots.txt是否误屏蔽了目录或分页;如果上述检查都正常,但日志中仍无记录,则可能是抓取配额或优先级问题,而不是页面本身不可发现。此时应继续观察日志趋势,而不是直接修改页面结构。
减少返工的关键是统一证据格式。建议交付一张表,每行至少包含:URL、发现来源(内部链接、站点地图、外链)、最近一次爬虫请求时间、HTTP状态码、索引状态、判断结论、负责人。判断结论只能写“已抓取且可索引”“已抓取但不可索引”“未抓取但可发现”“不可发现”四类,避免使用“可能有问题”这类模糊描述。
假设同一URL在站点地图中存在,但日志中连续多次抓取均返回503,这属于“已发现但抓取失败”,责任在服务端稳定性,而不是内容质量。若URL在站点地图中不存在,也没有任何内部链接指向,则属于“不可发现”,需要先补链接或站点地图,再谈索引。
上述方法适用于站点结构相对稳定、日志可获取、团队能维护URL清单的场景。如果站点大量依赖前端渲染或第三方平台托管,站内爬虫可能无法完整模拟搜索引擎行为,此时应以搜索引擎官方提供的抓取统计和URL检查工具为准,并区分“未抓取”和“已抓取未索引”两种状态。
判断结果只有落到具体URL和具体原因上,才能指导下一步动作。下一步建议:从差集中挑出10条代表性URL,按“不可发现”“抓取失败”“可抓取但未索引”分类,分别指定修复动作和复核时间,再决定是否扩大排查范围。