结论先行:当一批页面里只有一部分被发现,而你又缺少完整的抓取日志或后台权限时,可以把这批页面按一个可观测、可解释的差异拆成两组——一组是已被发现的页面,一组是尚未被发现的页面——再比较两组在某个可控变量上的分布差异。这样做的目的不是证明谁导致了收录,而是把“整批都没收录”收窄成“哪一类页面更容易被漏掉”。如果两组在多个变量上同时不同,或者样本量太小,这个对照就失效,只能当作线索,不能当作结论。
没有日志和权限时,能用的信号通常只有三类:页面自身属性、页面之间的链接关系、以及外部入口。划分对照组的起点,是找出一个在两组之间明显不对称、且你能解释的变量。常见可用的分组变量包括:
选一个变量,而不是一次比较全部。比如你怀疑“有内部链接的页面更容易被发现”,就把已发现组和未发现组按“是否被至少一个列表页链接”重新归类,再看两组比例。这个动作的结果决定下一步:如果差异集中在内部链接,下一步是补链接路径;如果差异不在链接,而在更新时间或模板,就该换一个变量重新分组。
一个能用的对照组,至少要满足三点。第一,两组页面来自同一批、同一时间窗口,避免把新旧页面的差异误当成变量差异。第二,除了你正在检验的那个变量,两组在其他关键属性上尽量接近,比如模板一致、内容类型一致、目录深度接近。第三,每组都有足够数量,个位数的差异不足以支撑判断。
假设一批 200 个页面中 40 个被发现、160 个未发现。若你按“是否有内部链接”分组,发现已发现组里 35 个有链接、未发现组里 30 个有链接,那么内部链接并不能区分两组,这个变量就该放弃。反之,如果已发现组几乎都有链接、未发现组几乎没有,才值得继续追。这里的数字只是说明比较方法,不是任何真实站点的实测结果。
最典型的反例是:两组页面在多个变量上同时不同。比如未发现组既缺少内部链接,又都是最近批量生成的,还都不在站点地图里。这时你无法判断是哪一个因素在起作用,对照就退化成“整批都有问题”。
另一个失效情形是把抓取限制当成索引结果。robots.txt 里禁止抓取某个目录,只能说明抓取被限制,不能说明页面已经被可靠地移出索引;反过来,允许抓取也不等于会被收录。站点地图同理,它只是提交线索,不保证收录。因此当你的分组变量是“是否在站点地图中”时,要清楚它检验的是“提交线索是否与发现相关”,而不是“提交就会收录”。
还要注意,请求量、抓取量或某个统计归零,不能单独证明你的处理正确。它可能来自抓取预算重新分配、入口变化、页面被合并,或统计口径本身变化。看到归零就下结论,容易把无关波动当成因果。
可执行的最小动作是:选定一个变量,把已发现和未发现两组各列出页面清单,逐页标注该变量,统计两组比例,然后只针对差异最大的那一类页面做一个改动。例如只给未发现组中“无任何内部链接”的页面补上一条来自同目录列表页的链接,等待一段时间后,重新用同一方法统计这组页面的发现情况。
这个动作的结果如何影响下一步:如果补链接后这组页面的发现比例向已发现组靠拢,说明内部链接路径值得继续扩展;如果没有变化,说明漏发现的原因更可能在别处,比如内容重复、入口过深或抓取频次分配,此时应换变量重新分组,而不是继续加链接。
但必须明确不能推出的结论:即使发现比例上升,也不能证明是链接单独导致了收录,因为同期可能还有别的东西变化;也不能据此承诺任何收录时间或排名结果。对照组的价值在于缩小怀疑范围,而不是给出保证。
最后一步是把分组依据、页面清单、改动内容和观察时间写下来,让下一次比较能接上。记录里要写清你检验的是哪个变量、两组样本量、改动前后的差异,以及你排除了哪些解释。这样即使数据不完整,后续接手的人也能判断这个对照是否还成立,而不是从头重猜。