辛普森悖论

分开看,A 药在每个分组里的治愈率都高于 B 药;合起来算,B 药的总体治愈率却反超 A。数据会“反转”,只因忽略了分组权重。

分类
概率反直觉
难度
烧脑
标签
统计、混淆变量、相关性
辛普森悖论 · 漫画配图
漫画 · 辛普森悖论

题目

某医院比较两种肾结石疗法的治愈率,按结石大小分成两组:

分组疗法 A 治愈率疗法 B 治愈率
小结石93/100 = 93%87/100 = 87%
大结石73/100 = 73%69/100 = 69%
合计166/200 = 83%156/200 = 78%

咦,A 在两个分组里都更高,合计也更高——这回没反转。我们把数字改一改:

分组疗法 A疗法 B
小结石81/87 = 93%234/270 = 87%
大结石192/263 = 73%55/80 = 69%
合计273/350 = 78%289/350 = 83%

现在:每个分组 A 都更高,但合计 B 反而更高! 这可能吗?

答案与解析

完全可能,而且上面就是真实论文里的数据(Charig et al., 1986)。

关键在于样本量(权重)被颠倒了:疗法 B 大量用在了容易治的小结石上(270 例),少量用在了难治的大结石(80 例);疗法 A 反之,主要集中在难治的大结石(263 例)。于是 B 被“容易病例”拉高了总体,A 被“困难病例”拖低了总体——即使它在每种难度下都更优。

合并时,原本该控制的“结石大小”这个混淆变量被混在总数里,结论就反转了。

背后的数学

这就是辛普森悖论:在分组层面成立的趋势,在汇总层面可能反转(或反之),当各组的样本量权重差异很大且分组与结果都相关时就会发生。

它的教训极其深刻:

  • 看“总计”前,先问分组是否均衡
  • 相关性不等于因果——背后可能有第三个变量在捣鬼;
  • 临床试验、人口普查、薪资性别差异等领域都曾栽在这个悖论上。

统计不是把数加起来那么简单,怎么分层、权重如何,直接决定你看到的是真相还是幻象。