核心做法是:把一次改版拆成“只改一个可归因变量”的批次,其余元素冻结并留档。判断该不该拆,取决于你当前最缺的是方向判断还是效率提升——前者必须单变量,后者可以在同一批次内做组合改版,但要接受无法归因到具体元素的代价。
两种做法都成立,前提不同。
判断依据不是改版幅度大小,而是你能不能为改动结果写出一句可证伪的结论。写不出,就该拆。
单变量改版的前提是其余条件真的没变。实际操作中,最容易在改版同时被动改变的是投放侧:预算、出价、定向、投放时段、素材轮换节奏。如果落地页改版和投放调整同期发生,转化数据的变化无法归因到页面。
实施动作:改版上线前记录一份基线快照,至少包含页面版本标识、投放计划名称与定向设置、出价方式、统计口径和观察时间窗。改版期间对这些项做冻结,并明确记录任何不可避免的变动。
这个动作的结果直接影响下一步:如果基线期间投放侧已经变动,先等它稳定再开始页面试验;否则你拿到的差异里混着投放变量,只能重跑。
拆开跑适合假设之间可能互相干扰的情况。例如按钮文案和表单字段数同时改,前者影响点击意愿,后者影响填写完成率,两个指标混在一起时,你无法判断是文案吸引了更多人点、还是字段变少让完成率上升。此时拆开跑,先测文案,锁定后再测字段。
打包跑适合假设之间强耦合的情况。例如首屏标题与配图本就表达同一主张,单独换标题会让图文不一致,反而制造出一个人为的低效版本。此时打包成一个方案,对比旧版整体表现。
一个注明假设的短例子:假设某落地页首屏按钮点击率偏低,你同时把按钮颜色、按钮文案、按钮位置都改了,结果点击率上升。你无法知道是颜色还是文案起作用,下一次想复用经验时没有可靠依据。若只改文案,点击率不变,你至少排除了文案这一项,下一步可以试位置——这就是单变量带来的可累积性。
除了页面上看得见的元素,还有几类改动常被忽略,却会污染试验:
这些变量不需要全部控制,但需要知道哪些没控住,并在解读结果时把它们列为备选解释。
改版后数据没变化,不等于改动无效。样本量不足、观察窗口太短、流量结构变化,都能让真实差异被淹没。反过来,数据变好也不能单独证明是页面改动的功劳——投放侧调整、季节性需求波动、外部竞争环境变化都是合理解释。
动作建议:在试验开始前就约定判断标准,包括观察时长、最小可判断的差异方向,以及出现什么情况算作无效重跑。达到约定条件后再决定是保留、回滚还是进入下一个单变量测试。这样每一轮改版都能留下一条可复用的结论,而不是一堆无法归因的数据。