站长实用工具:一次全站扫描被中断后怎样判断已覆盖范围

📍 WDQWDWQD987AAAAA:216.73.217.17
📱 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
🔗 /6e65a5f832cc.html
📄

站长实用工具:一次全站扫描被中断后怎样判断已覆盖范围

扫描被中断后,不要直接重跑整站,也不要凭感觉认为“大部分已经扫过”。可行的做法是先用已有日志重建一份可核对的覆盖清单,再决定是补扫、保留结果还是放弃这轮数据。判断的核心不是中断前跑了多久,而是哪些URL已经有明确结果、哪些只有访问记录、哪些完全没有出现。

先分清三种记录,不要把它们混成“已覆盖”

多数站长实用工具在扫描过程中会留下不同层次的记录,中断后最容易误判的地方,就是把“请求过”当成“已经完成分析”。实际应拆成三类:

把这三类分开统计后,你会得到一张比“扫描进度百分比”更可靠的底图。进度条在中断场景下往往只反映任务调度位置,不反映结果完整度。

用站点自身的URL来源做交叉核对

只依赖工具内部记录,容易漏掉从未被发现的页面。更稳妥的做法是准备一份独立URL清单,再与扫描结果比对。清单可以来自站点地图、内链抓取结果、历史导出的URL列表,或服务器访问日志中近期出现过的路径。

具体动作是:把独立清单与扫描结果按URL做一次匹配,输出三个集合——两边都有、只在扫描结果中、只在独立清单中。结果如何影响下一步很直接:

  1. 如果“只在独立清单中”的URL集中在某个目录,说明中断恰好发生在该区域,补扫应优先覆盖这个目录,而不是从头再来。
  2. 如果“只在扫描结果中”出现大量已不存在的旧地址,说明这轮数据里混入了历史遗留URL,后续取舍要先把它们标记为退出候选。
  3. 如果两边高度重合,且已有结论的记录占比高,才值得考虑保留这轮数据并只做增量补扫。

按目录和模板判断覆盖是否足够,而不是按总数

假设一个站点有产品页、文章页和标签页三种模板,扫描中断时总数只完成了六成。这个比例本身不能说明问题,因为如果完成的部分全部集中在文章页,而产品页和标签页几乎没扫到,那么这轮数据对“旧内容退出”这个决策几乎没有价值。

更实用的判断单位是目录或模板。对每个分组分别看三件事:已有结论的比例、只有访问痕迹的比例、完全未出现的比例。只有当需要做决策的那类页面已经形成足够完整的结论,这轮数据才具备保留价值;否则应补扫该分组,而不是补扫全站。

这里有一个前提需要明确:分组依据必须来自站点自身结构,而不是工具默认的分类。如果工具的分类维度与你的实际目录不一致,应以URL路径和页面模板为准重新归组。

把覆盖判断落到保留、改写或退出的取舍上

覆盖范围判断清楚之后,旧内容的处理才有依据。三种取舍各自适用不同前提:

注意一个容易出错的推论:某类URL在扫描结果中数量为零,不能单独证明它们已经失效。零结果也可能来自扫描范围设置、robots限制、中断时机,或清单本身不完整。需要结合服务器日志或内链情况再确认一次。

补扫之前先固定范围,避免二次中断后再次返工

如果决定补扫,不要直接重跑全站。更有效的动作是把补扫范围限定为“只有访问痕迹”和“完全未出现”的URL集合,并单独保存这一轮的输出。这样即使再次中断,你仍然可以把两轮结果合并成一张覆盖表,而不是每次都被迫从头开始。

合并时保留一个字段:每个URL的结果来自哪一轮。这个字段在后续判断时很有用——如果某个URL在两轮中都只有访问痕迹而没有结论,通常说明它本身响应异常,而不是扫描被中断导致的遗漏。此时应把它单独列出,而不是继续放进补扫队列。

最后需要核对的是工具本身的记录方式。不同站长实用工具对“已扫描”“已分析”“已跳过”的定义并不一致,具体字段含义和导出范围需要以你实际使用的工具说明为准。在没确认这些定义之前,任何覆盖比例都只能当作参考,不能直接作为删除或保留旧内容的唯一依据。

图1 图2

nginx