扫描被中断后,不要直接重跑整站,也不要凭感觉认为“大部分已经扫过”。可行的做法是先用已有日志重建一份可核对的覆盖清单,再决定是补扫、保留结果还是放弃这轮数据。判断的核心不是中断前跑了多久,而是哪些URL已经有明确结果、哪些只有访问记录、哪些完全没有出现。
多数站长实用工具在扫描过程中会留下不同层次的记录,中断后最容易误判的地方,就是把“请求过”当成“已经完成分析”。实际应拆成三类:
把这三类分开统计后,你会得到一张比“扫描进度百分比”更可靠的底图。进度条在中断场景下往往只反映任务调度位置,不反映结果完整度。
只依赖工具内部记录,容易漏掉从未被发现的页面。更稳妥的做法是准备一份独立URL清单,再与扫描结果比对。清单可以来自站点地图、内链抓取结果、历史导出的URL列表,或服务器访问日志中近期出现过的路径。
具体动作是:把独立清单与扫描结果按URL做一次匹配,输出三个集合——两边都有、只在扫描结果中、只在独立清单中。结果如何影响下一步很直接:
假设一个站点有产品页、文章页和标签页三种模板,扫描中断时总数只完成了六成。这个比例本身不能说明问题,因为如果完成的部分全部集中在文章页,而产品页和标签页几乎没扫到,那么这轮数据对“旧内容退出”这个决策几乎没有价值。
更实用的判断单位是目录或模板。对每个分组分别看三件事:已有结论的比例、只有访问痕迹的比例、完全未出现的比例。只有当需要做决策的那类页面已经形成足够完整的结论,这轮数据才具备保留价值;否则应补扫该分组,而不是补扫全站。
这里有一个前提需要明确:分组依据必须来自站点自身结构,而不是工具默认的分类。如果工具的分类维度与你的实际目录不一致,应以URL路径和页面模板为准重新归组。
覆盖范围判断清楚之后,旧内容的处理才有依据。三种取舍各自适用不同前提:
注意一个容易出错的推论:某类URL在扫描结果中数量为零,不能单独证明它们已经失效。零结果也可能来自扫描范围设置、robots限制、中断时机,或清单本身不完整。需要结合服务器日志或内链情况再确认一次。
如果决定补扫,不要直接重跑全站。更有效的动作是把补扫范围限定为“只有访问痕迹”和“完全未出现”的URL集合,并单独保存这一轮的输出。这样即使再次中断,你仍然可以把两轮结果合并成一张覆盖表,而不是每次都被迫从头开始。
合并时保留一个字段:每个URL的结果来自哪一轮。这个字段在后续判断时很有用——如果某个URL在两轮中都只有访问痕迹而没有结论,通常说明它本身响应异常,而不是扫描被中断导致的遗漏。此时应把它单独列出,而不是继续放进补扫队列。
最后需要核对的是工具本身的记录方式。不同站长实用工具对“已扫描”“已分析”“已跳过”的定义并不一致,具体字段含义和导出范围需要以你实际使用的工具说明为准。在没确认这些定义之前,任何覆盖比例都只能当作参考,不能直接作为删除或保留旧内容的唯一依据。