用 AI 做实验设计:别只让它给方案,要先定义假设、指标和停止条件
AI 能生成实验方案,却不能替代严谨设计。本文讲清如何判断是否适合实验、写可证伪假设、定义指标口径、样本周期与停止条件。
“我们试试把按钮改成绿色,看转化会不会提升。”一周后,某天的数据高了 8%,团队宣布实验成功。过几天再看,提升消失了;有人才发现期间流量渠道变了、样本很小,而且大家是在看到结果后才决定用哪项指标。
AI 能快速提出实验方案、生成指标和分析结果,但如果问题、假设和停止条件不清楚,它只会更快地产出一份貌似科学的计划。实验设计的核心不是“做一个 A/B 测试”,而是让不同解释接受公平比较,并在看结果之前规定怎样判断。
先写什么证据会支持或推翻假设,再收数据。否则实验很容易变成给既有想法找证明。
先判断:这个问题适合做实验吗
实验适合回答一个可操纵变化是否影响结果,例如新引导是否提高首次任务完成率。它不适合直接回答长期品牌价值、极低频灾难、无法控制的政策变化,或风险高到不能随机分配的场景。有时访谈、日志分析、可用性测试或准实验更合适。
| 问题 | 更适合的方法 |
|---|---|
| 用户为什么放弃流程 | 访谈、录像与行为日志 |
| 两个版本哪个提高完成率 | 随机对照实验 |
| 历史政策变化带来什么影响 | 时间序列或准实验 |
| 极端故障能否安全恢复 | 沙盒演练与故障注入 |
把想法改写成可证伪假设

“新方案更好”无法直接检验。完整假设至少包含目标对象、具体变化、主要结果、方向、时间窗口和作用机制。例如:“对首次注册且未导入数据的用户,展示示例项目,相比空白页,会在 24 小时内提高首次核心任务完成率,因为用户更容易理解操作起点。”
同时写零假设和失败条件。让 AI 生成三种可能推翻原想法的结果,并指出假设中哪些词无法观测。模型可以帮助把语言变精确,但业务机制和伦理边界必须由团队确认。
只选一个主要指标
指标越多,偶然出现“显著提升”的机会越大。实验开始前指定一个主要指标,少量次要指标用于解释,护栏指标用于防止局部优化伤害整体。例如提高点击率的同时,要观察投诉、误触、退款或任务成功率。
| 指标角色 | 用途 | 示例 |
|---|---|---|
| 主要指标 | 决定假设是否获得支持 | 24 小时核心任务完成率 |
| 次要指标 | 理解机制与分群差异 | 完成耗时、步骤退出率 |
| 护栏指标 | 避免副作用 | 投诉率、错误率、退款率 |
| 诊断指标 | 检查实验是否正常 | 分流比例、曝光日志 |
为每个指标写清分母、去重规则、时间窗口、异常值和数据来源。“活跃用户”“完成”“转化”必须有可执行定义。AI 可以检查口径冲突,却不能替数据负责人确认真实埋点。
对照组只改变一个关键因素
实验组和对照组应尽量同时运行、随机分配,并除目标变化外保持一致。如果新页面同时改文案、价格、流程和渠道,即使结果变化,也不知道由什么造成。无法完全随机时,要记录分配规则和潜在混杂因素。
样本量不是“跑几天看看”
所需样本取决于基线、希望检测的最小有意义变化、波动、显著性和统计功效。样本太小可能错过真实效果,也可能把随机波动当结果。不要让 AI 随口给一个数字;应使用适合指标类型的统计工具,并由懂统计的人复核。
实验时长还要覆盖完整业务周期。工作日和周末、月初和月末、活动流量和平时用户可能不同。达到样本量但只覆盖异常短窗口,结论仍可能无法推广。
开始前写好停止条件

频繁查看结果,一看到有利就停止,会增加误判。预先规定最短时长、目标样本、正常结束、护栏触发暂停和数据质量异常条件。若采用序贯检验等允许持续观察的方法,也要按相应统计规则设计。
检查实验本身是否真的运行
- 分流比例是否接近预期,是否出现样本比例不匹配?
- 用户是否可能同时进入多个组或在设备间串组?
- 曝光与结果事件是否完整、时序是否正确?
- 实验期间是否有发布、营销或外部事件只影响某组?
- 机器人、内部账号和重复用户如何处理?
先做 A/A 测试或小流量试运行,可以发现分流与埋点问题。AI 适合从监控摘要中找异常,但不能把缺失数据自动补成真实观测。
分析时先按预注册计划,再探索
先报告主要指标、置信区间、实际效应大小和护栏变化,再做分群探索。统计显著不等于业务值得,未显著也不等于证明没有效果。重点是结果与最小有意义变化相比如何,以及不确定范围有多大。
探索性发现可以生成下一轮假设,但不能包装成预先计划的结论。让 AI 生成多种解释和反例,并要求它指出哪些分析是事后选择。
实验结束前先约定怎样做决定
结果可能落在灰色区:主要指标小幅改善但护栏变差,整体无变化却某个重要人群受益,或置信区间同时包含有价值提升和不可接受下降。实验计划应提前写出“上线、继续收集、缩小范围、重新设计、停止”的判断框架,而不是把所有压力留到结果出来以后。
决策记录要保留数据质量、实际效应、不确定性、护栏、适用人群和实现成本。即使没有得到期待结果,也应发布结论,避免其他团队重复相同实验。AI 可以生成结果摘要的多个版本,但不能把“没有充分证据支持”润色成“证明完全无效”。
实验也有伦理和公平边界
涉及价格、健康、就业、信用、未成年人、隐私和重大权益时,要进行更严格的伦理、法律和业务审查。不能因为“只是测试”就隐藏实质风险。需要时获得知情同意、限制暴露、提供退出和补救机制。
AI 辅助实验设计的流程
- 写清业务问题、已有证据和为什么需要因果判断。
- 让 AI 将想法改写为多个可竞争、可证伪假设。
- 人工确定主要指标、护栏、口径和最小有意义变化。
- 设计分流、样本、时长、停止条件和异常处置。
- 由数据、业务和风险负责人预审并冻结分析计划。
- 先验证分流与数据质量,再按计划分析。
- 记录结论、局限、适用范围和下一步。
提示词模板
“你是实验设计审阅员。基于以下背景,输出目标对象、干预、对照、可证伪假设、作用机制、主要指标、护栏指标、口径风险、混杂因素、随机化单位、最小有意义变化、停止条件和伦理风险。缺失数据写【待确认】,禁止虚构样本量。最后提出三种可能推翻假设的结果,并区分预注册分析与探索分析。”
上线前检查
- 问题真的需要实验回答吗?
- 主要指标是否唯一、可解释且口径明确?
- 是否只改变目标因素,并有合理对照?
- 样本、周期和停止条件是否预先确定?
- 护栏、数据质量和伦理风险是否覆盖?
- 是否承诺报告效应大小、不确定性和失败结果?
AI 可以让实验计划更完整,却不能让一个含糊问题自动变科学。真正可信的实验,靠的是事前约束、可靠数据、公平比较和对不确定性的诚实表达。
本文为读懂 AI 原创内容。涉及高风险决策、个人数据和受监管领域时,请由统计、伦理、法律与业务专业人员共同审查。