先给出结论:不要按“已发现/未发现”划分对照组,而应按页面是否真正参与过抓取请求来划分。已发现只是进入过待抓取队列,未发现可能连队列都没进。把这两类混在一起比较,得到的差异往往来自抓取路径,而不是页面本身质量。
批量提交后,同ip网站下常见三种状态:URL 出现在抓取日志中、URL 只出现在站点地图或内链里、URL 完全没有任何请求记录。只有第一种能作为实验组,第二种是候选组,第三种是空白组。若把第二种和第三种合并成“未发现组”,你比较的其实是“有入链”和“无入链”,结论会跑偏。
一个可执行动作:从服务器日志中按小时提取目标目录的请求行,把每个 URL 标记为“有请求”“无请求”。这个动作的结果直接决定下一步——如果“无请求”的 URL 占比很高,先查内链和站点地图,而不是改页面正文。
如果未发现页面全部位于列表页第 3 页之后,或只靠一个入口链接到达,优先保留内容,只调整发现路径。做法是把其中一部分 URL 加入一个已有抓取频率的聚合页,另一部分保持原样,两周后对比日志中新增请求数。这里对照组是“未加内链的同类页面”,而不是全站未发现页面。
已发现但长期不再被抓取,说明首次抓取后没有形成继续抓取的理由。此时可对一半页面补充结构化数据或更新正文中的关键信息,另一半不动,观察日志中是否出现再次请求。注意:站点地图更新不保证收录,只增加被重新发现的机会;若日志中完全没有再抓记录,改写正文的优先级应低于检查同ip下其他站点的抓取预算占用。
如果批量页面只是筛选参数、排序副本或会话标识产生的变体,且日志显示它们从未被请求,退出(合并、规范化或返回 404/410)比继续提交更合理。前提是这些 URL 没有外部链接或历史流量。若无法确认外部链接情况,先保留并设为不可索引,而不是直接删除。
一个假设例子:某目录有 200 个页面,日志显示 60 个有请求、140 个无请求。若把 140 个全部当作对照组,其中可能混有 30 个被 robots.txt 禁止的 URL。剔除这 30 个后,对照组变为 110 个,再按内链深度分层。这个动作的结果是:如果浅层未发现页面也很多,问题更可能在站点地图或入口页,而不是页面深度。
建议顺序是:先按请求状态分层,再按内链深度分层,最后才按内容类型分层。每层至少留一组不动作为参照。若两周后新增请求只出现在你改过的那一层,说明改动方向有效;若各层都没有变化,下一步应检查同ip下其他站点的抓取请求是否在同一时间窗口上升,而不是继续扩大改写范围。
最后提醒:不同搜索引擎对站点地图、robots.txt 和索引移除的支持情况须分别核查,不能把一家的日志结论直接套到另一家。对照组的价值在于让你知道变化发生在哪一层,而不是证明某个动作一定带来收录。