LZLZL/预测市场/研究方法
免费究 · 系统 辛 研究方法旗舰

判决门
与单次读数

2026-08-21 · 为什么「多看几眼」会毁掉一个实验

预注册写下判据之后,还有两件事决定它有没有用: 门是怎么定的,和你允许自己看几次。 第二件尤其反直觉 —— 反复查看数据,本身就会制造出显著性, 哪怕你一个数字都没改。

门:四条一起用,缺一不可

单一门槛很容易被偶然满足。我们用的是四条并联,任一不过即失败

它挡住什么
① 幅度:毛超额 ≥ 成本线挡住「有边但不够付成本」
② 显著性:z ≥ 2.0挡住「幅度够但是运气」
③ 赢过空模型:三条都要赢挡住「其实是行情,不是策略」
④ 稳定性:前后两半同号挡住「全靠某一段撑着」

四条各自防一类假阳性,而且互相不能替代。 我们那条线的终读就是最好的例子:③④ 都 PASS,①② 都 FAIL

⚠ 只看 ③④ 会得出完全相反的结论

「它赢过了三个空模型,前后两半也同号」—— 听起来像是找到了真东西。 但幅度只有 +1.56pp,而成本线是 2.25pp。

赢过随便乱下注 ≠ 赢过成本。 一个超额 1.56pp、成本 2.25pp 的策略不是「小赚」,是每一笔都在确定地亏

「打赢了空模型」是很多人拿来自我说服的那句话, 它只证明策略不是纯噪声,不证明它能覆盖手续费

单次读数:为什么只能看一次

这是整套方法里最反直觉的一条。数据就在那里,为什么不能多看几眼?

因为「看」本身是一次检验 看 20 次,就等于做了 20 次检验 —— 而每次都有偶然通过的机会

如果你每天看一眼,看到好数字就宣布成功、看到坏数字就说「样本还不够」, 那么只要跑得够久,你几乎一定会在某一天看到一个「显著」的结果 —— 即使这个策略毫无价值。你不是在检验策略,是在等一个足够极端的随机波动

做法实际在做什么
攒够 n 读一次一次检验
每天看,好了就收多次检验,且只报最好的一次
不好就「再等等」同上,而且永远不会失败

最后一行是关键:一个允许「再等等」的实验,没有失败这个结果。 它只有「成功」和「还没成功」两种状态 —— 而那不是实验,是等待。

可以看,但不能据此行动

完全不看是不现实的 —— 线在跑,你总会瞄一眼。我们的规矩是分开两件事:

允许禁止
随时看当前数字据此改判据
看趋势、查数据质量据此提前收手或延长
发现装置故障就停因为数字难看就停

第三行的区分很重要:因为「仪器坏了」停,和因为「结果难看」停,是两回事。 前者是必须的(数据是脏的,继续跑没意义),后者是作弊。 分辨方法:问自己「如果数字很好看,我还会因为这个理由停吗?」

什么时候可以提前判

有一种提前读数是合法的:当剩余样本在数学上已经不可能翻盘

我们那条线的终读就是这么来的。触发线是 n=2,500,实际读的时候 n=2,468(98.7%)。 判词里写着提前开判的理由:

要把超额从 +1.56 拉到 +2.25, 剩下那 32 个窗得平均贡献 +55pp 而单窗的理论上限本身就在这个量级 —— 数学上不可能

另一条更早被判死的线也是同样的算法:n≈460 时超额 −1.8pp, 要过 +4pp 的门,剩余约 40 个窗得平均 +71pp,高于单窗理论上限

这类提前停止有个明确条件

只能往「提前判死」的方向用,不能往「提前宣布成功」的方向用。

因为「已经不可能通过」是一个可以严格计算的事实, 而「已经肯定会通过」永远不是 —— 后面的样本随时可能变坏。

不对称是有道理的:提前判死省下的是继续烧钱的时间, 提前宣布成功省下的是本该继续检验的时间。前者是收益,后者是风险。

怎么定样本量

门槛和样本量是配套的,不能分开定。粗略的关系:

z = 超额 ÷ 标准误,而标准误 ∝ 1 / √n n 越大,同样的超额越显著

实操上倒过来用:你希望能检测出多大的边,就需要多少样本。 我们那条线的估算是 n≈2,500 时标准误约 1.0pp —— 所以 z≥2.0 大致对应 「超额至少 2pp 才可能通过」。这和从成本算出来的 2.25pp 门大致匹配, 两条门互相校验,不是随便凑的。

一条实用推论如果你算出来需要的样本量远超你能攒到的量, 那么这条线在开始之前就该放弃 —— 你永远得不到能下结论的数据。 这个判断成本是零,但很少有人做。

一句话记住

门要出来、要并联、要提前冻结; 数据只读一次。 一个允许「再等等」的实验没有失败这个结果 —— 而没有失败可能的实验,也证明不了成功。

证据怎么自己核对

四条门并联 任一不过即失败;我们那条线的终读为 ③④ PASS、①② FAIL。
终读数字 n=2,468(触发线 2,500 的 98.7%);超额 +1.56pp(门 2.25pp);z=1.62(门 2.0)。
提前开判的算术 剩余 32 窗需平均贡献 +55pp 才能翻盘 —— 与单窗理论上限同量级,不可能。
另一次同类判死 n≈460 时超额 −1.8pp,剩余约 40 窗需平均 +71pp,高于单窗理论上限。
样本量与门的互校 n≈2,500 时标准误约 1.0pp,z≥2.0 对应超额约 2pp, 与从成本算出的 2.25pp 门大致匹配。
复核日期 2026-08。

相关接着读什么

辛 · 研究方法
预注册:先立门后看数据
辛 · 研究方法
kill rule 与「预先认领的死法」
辛 · 研究方法
空模型:赢不了 null 的盈利不是 edge
癸 · 判死档案
这套门判死的那条线
本文属教育与研究记录,不构成投资建议,不承诺任何回报。规则与接口行为以官方文档为准,本文标注考证日期, 随时可能变更。预测市场在部分国家和地区受限制或不可用,参与前请自行确认当地法规。