先看任务记录,而不是先看结果列表。工具如果保留了任务日志、进度计数或分页游标,就能据此判断中断前走到哪一步;如果什么都没有,只能把这次扫描当作范围不明的部分样本,重新规划一次可续跑的抓取。判断的核心不是“扫了多少条”,而是“中断点是否可定位、已得数据是否与URL一一对应”。
全站扫描通常至少经过三层:URL发现、页面请求、关键词与指标解析。中断可能只停在其中一层,三层的影响完全不同。
能区分这三层的证据是任务日志里的阶段标记、进度百分比、最后处理的URL,以及本地是否留有原始响应。若日志只显示一个总进度条,就要用导出数据反推:把已得记录里的URL与站点地图、导航链接做比对,看缺口集中在某目录还是随机分布。随机分布更像请求中断,集中缺口更像发现层没走完。
不要凭感觉估算覆盖率。取三份可核对的清单做交集与差集:
三者两两相减,缺口的位置比缺口的数量更重要。假设一个内容站有约两千个可索引URL,导出结果一千二百条,其中八成集中在博客目录,而产品目录几乎为空——这更像发现规则或分页深度限制,而不是随机中断。反过来,如果缺口均匀散布在各目录,且日志显示请求在某一时刻整体停止,则更可能是会话超时或额度耗尽。这里的两千和八成只是说明比较方法的假设数字,不是任何工具的实际表现。
完成比对后,下一步动作取决于缺口性质:结构性缺口要改抓取入口或分页设置再重跑;随机性缺口可以只对缺失URL补抓,把两次结果合并。合并前先统一字段口径,否则同一URL在两批数据里的关键词字段可能不可比。
三个取舍各有成立前提,不必都选。
保留适用于中断点可定位、已得数据带URL和时间戳、且缺口能用补抓闭合的情况。此时把这次结果标记为“部分覆盖”,在后续分析中只对已覆盖URL下结论,不把缺失当作“没有关键词”。
改写适用于发现层本身有问题:分页没走完、参数URL被误判、动态列表未展开。这时保留旧数据意义有限,应调整抓取范围或过滤规则后重跑,并把新旧两次的URL集合做差异记录,避免同一页面重复计入。
退出适用于日志缺失、导出数据无法与URL对应、或中断原因不明且无法复现。继续在不可核对的数据上做关键词决策,风险高于重新扫描的成本。退出的动作是清空本次结果,而不是把它当作“大致可用”的底稿。
多个角色对“扫到哪了”有不同理解时,争论通常来自各自看的是不同层的数据。运营看导出条数,技术看请求日志,负责人看进度条。把分歧落到一张核对表上:中断时间点、最后成功处理的URL、已导出记录数、日志中最后一次请求、缺口分布特征。每一项都要求有来源,而不是口头估计。
核对表填完后,通常会出现两种结论:一是覆盖边界清楚,只需补抓;二是边界不清,需要重跑。两种结论对应不同的时间与人力投入,先确认属于哪一种,再决定是否继续使用这批数据。若核对表本身填不满,说明这次扫描的可追溯性不足,下次应在启动前就打开任务日志与原始响应留存。
一是可续跑:确认工具是否支持从上次中断位置继续,或至少能导出已处理URL清单用于去重。若不支持,就按目录或URL段分批扫描,让每批的边界独立可查。
二是可对账:每批结束后立即记录该批的URL数量与范围,与站点地图比对一次,而不是等全站跑完再统一检查。这样即使再次中断,也能快速说出缺的是哪一段。
具体工具是否提供续跑、日志留存或分批能力,需要以你实际使用的版本和账户权限为准,不能凭通用描述假定。判断覆盖范围的第一步始终是找到可核对的记录;找不到记录时,最稳妥的取舍是重新规划一次边界清晰的扫描,而不是在不确定的数据上继续推导关键词结论。