先回答结论:不要按“已发现/未发现”直接分组,而要先按页面是否真的值得被抓取来分层,再在每一层内部随机划分对照组。因为“只有一部分被发现”往往不是抓取预算不足,而是旧内容、旧系统或旧合作关系退出后,站内仍然保留了低价值入口,蜘蛛沿着这些入口消耗了额度。对照组的目的是判断:把某类入口或某类页面降级后,剩余值得保留的页面是否更容易被发现。
批量页面只有一部分被发现,常见原因是站内链接结构把大量旧页面和新页面混在一起。此时有两种选择,条件不同:
判断依据不是页面数量,而是这些页面在过去一段时间内是否还有自然点击、内部搜索命中或外链指向。若三者都接近零,优先让页面退出;若仍有零散点击,优先只撤入口。把这两种动作混在同一组里,后续无法区分是入口减少起了作用,还是页面退出起了作用。
直接拿“已发现”和“未发现”做两组,会混入页面质量差异。更稳妥的做法是先分层,再在层内随机分组。可按以下方式操作:
一个假设例子:假设有400个旧合作落地页,其中200个仍有外链,200个没有。不要直接抽200个做处理组。应先分成“有外链”和“无外链”两层,在每层内各抽一半做处理组。这样即使结果有差异,也能知道差异来自外链还是来自入口撤除。
实施时先做一件事:把处理组页面从站内批量入口中移除,例如从旧列表页、旧标签聚合页、旧推荐模块中撤掉链接,但保留页面可访问。观察一个抓取周期后,比较处理组和对照组的抓取频次变化。
如果处理组的抓取频次没有下降,而对照组也没有上升,说明这些入口不是瓶颈,下一步应检查站点地图和内部搜索是否仍在大量暴露旧页面。如果处理组抓取频次下降、同时保留页面的抓取频次上升,说明入口竞争确实存在,可以扩大撤入口范围。如果处理组和对照组都没有明显变化,不要急着下结论,因为抓取量本身受更新频率、外链变化和服务器响应影响,不能单独归因于入口调整。
另一种情况是页面本身退出。若处理组页面返回410后,站点地图中仍保留这些URL,蜘蛛可能继续访问并得到无效响应。此时应同步清理站点地图和内部链接。但要注意,robots.txt 的抓取限制不等于可靠的索引移除,站点地图不保证收录,所以清理后仍需用抓取日志验证,而不是只看提交状态。
以下页面不适合纳入本轮对照:
这些页面应单独列出,不参与随机分组。它们的处理结果也不能用来推断其他页面的抓取表现。若确实需要观察它们,应单独设一个小规模观察组,并注明假设条件。
每组至少记录四项:页面URL、所属层、执行动作、执行日期。观察指标用抓取日志中的响应码和抓取时间,不用搜索排名或流量代替。因为排名和流量变化可能来自其他因素,不能证明抓取优化本身有效。
当处理组中值得保留的页面抓取频次稳定上升,且未发现页面不再占用大量抓取额度时,才考虑把动作扩展到同一层的其余页面。若处理组和对照组差异不明显,应回到入口清单,检查是否还有未撤掉的批量链接。整个判断以可复核的记录为准,不以一次抓取量归零作为处理正确的证据。