识别样本污染的关键,不是先怀疑分析工具,而是先把“谁被分到了哪个版本”变成可核对的分配记录,再检查各组样本的来源构成是否可比。只比较两组的汇总指标,通常无法判断污染来自分流、抓取还是统计口径。
样本污染可能发生在三个不同层面,处理动作完全不同。
如果只看到B版本转化率低于A版本,先不要下结论。把每个版本的访客ID、首次进入时间、命中版本、来源渠道逐条导出,观察同一ID是否出现在两个版本中。出现跨版本重复的ID,说明分流层已经污染,后续指标对比失去意义。
一个可用的证据链至少包含三样东西:分配日志、采集完整度、口径说明。假设某页面做A/B测试,A为旧模板,B为新模板。你可以先取一周的分配日志,统计每个访客ID命中的版本数量;再对比两个版本各自被统计脚本覆盖的页面比例;最后确认第三方估算流量与站内访问在时间粒度上是否一致。
如果分配日志显示约一成访客ID同时命中两个版本,而采集完整度两组接近,那么优先修分流逻辑,而不是调整分析模型。修完分流后重新取样,再判断版本差异。这个动作的结果会直接影响下一步:若跨版本ID消失但差异仍在,才值得继续检查页面内容或加载速度。
两者在数据上的表现容易混淆,但可以用一组可区分原因来判断。
当三项中有两项异常,样本污染的可能性高于真实版本差异。此时继续扩大样本量只会放大偏差,正确动作是回到分流与采集环节修正。
个别样本成立不等于规模化后成立。假设你在小流量下发现B版本停留时间更长,但流量放大后该优势消失,常见合理解释包括:小样本中早期访客更活跃、分流规则在大流量下出现缓存穿透、或统计脚本在高并发下丢失部分事件。这些解释都需要用分配日志和采集日志验证,不能仅凭停留时间归因。
因此,处理方案应写明适用条件:分流必须保证同一访客稳定命中同一版本;采集必须覆盖两个版本的全部目标页面;口径必须统一到同一统计定义。任一条件不满足,结论只能视为待验证假设,不能直接用于全量切换。下一步动作应是先修复不满足的条件,再重新取样对比。