终止条件应当在试验开始之前就写下来,并且分成两类:一类是“停止推广”的条件,一类是“继续推广”的条件。判断依据不是试验页表现好不好,而是它相对对照组或基线是否出现了稳定、可归因的差异。如果试验页的改动同时影响抓取、收录和点击,而你又没有分开观察,那么任何单一指标的上升或下降都不足以支持全站推广。
把试验页推广到全站之前,必须先回答一个问题:试验页和谁比。两种常见做法是同期对照和前后对比。同期对照是选一批结构、内容量、历史表现接近的页面,一部分改,一部分不改,同时观察;前后对比是同一批页面改动前后各观察一段时间。
同期对照的代价是需要足够多的可比页面,而且两组页面之间可能互相影响,比如内链调整会同时改变两组的抓取路径。前后对比的代价是时间因素混入,季节、搜索需求变化、数据采集口径调整都会让差异失真。选择条件可以这样定:如果站点有足够多同类页面,优先用同期对照;如果页面数量少、无法配对,才用前后对比,并且把观察窗口拉长到能覆盖至少一个需求波动周期。
一个常见的反例是:试验页恰好是站内权重最高的几页之一,而对照页是权重较低的页面。这种情况下试验页表现更好,可能只是页面自身基础不同,而不是改动有效。此时终止条件里的“继续推广”就不成立,应当先重新配对或改用同页前后对比。
阈值不需要复杂,但必须提前写清楚,并且注明假设。假设可以这样设:如果试验页在观察窗口内,目标指标相对对照组的差异方向与预期一致,且差异不是由单日异常值贡献的,就继续推广;如果差异方向相反,或差异完全集中在某一天,就停止。
具体动作上,可以这样做:先记录试验页和对照页在改动前的基线值,包括抓取频次、收录状态、目标查询的展现和点击。改动后按固定间隔记录同一组值。当出现下面任一情况时触发停止:
这些动作的结果会直接影响下一步:触发停止,就回到改动前的版本,并检查是改动本身的问题还是试验设计的问题;没有触发停止,也不等于可以全站推广,还要看差异是否稳定到足以支撑更大范围。
抓取量、收录量或某个查询的展现量归零,不能单独证明改动失败。它们还有别的合理解释:数据采集口径变化、日志采样方式调整、搜索需求本身下降、页面被合并或重定向、甚至只是记录周期太短。把这些信号直接当成终止条件,容易把一次本来有效的改动误判掉。
反过来,试验页点击上升也不能单独作为继续推广的依据。点击上升可能来自标题改动吸引眼球,但页面内容并没有更好满足需求,全站推广后可能带来更高的跳出和更低的后续转化。因此终止条件里最好同时包含一个“质量侧”的观察项,比如目标查询的后续行为是否同步改善,而不是只看入口指标。
假设某站有 40 个同类产品页,选 20 个改版,20 个不动,观察四周。终止条件写成:若改版组在第四周的目标查询点击相对对照组没有正向差异,或差异仅出现在第一周,则停止推广;若第四周仍有稳定正向差异,且改版组没有出现收录回退,则进入下一阶段,把改动推广到剩余 20 页并继续观察两周。
这个例子里,四周和 20 页都是假设值,不是通用标准。实际取值取决于页面更新频率和需求波动幅度。关键不是数字本身,而是先写条件、再动手,避免看到结果之后才倒推标准。
现在就可以做一件事:把本次试验的停止条件和继续条件写成一段简短记录,连同基线值、观察间隔和对照组划分一起保存。下次改动前先读这段记录,确认条件仍然适用;如果不适用,先修改条件再开始,而不是边做边改。这样推广到全站时,你依据的是事先约定的判断,而不是事后挑选出来的指标。