辛普森悖论
分开看,A 药在每个分组里的治愈率都高于 B 药;合起来算,B 药的总体治愈率却反超 A。数据会“反转”,只因忽略了分组权重。
题目
某医院比较两种肾结石疗法的治愈率,按结石大小分成两组:
| 分组 | 疗法 A 治愈率 | 疗法 B 治愈率 |
|---|---|---|
| 小结石 | 93/100 = 93% | 87/100 = 87% |
| 大结石 | 73/100 = 73% | 69/100 = 69% |
| 合计 | 166/200 = 83% | 156/200 = 78% |
咦,A 在两个分组里都更高,合计也更高——这回没反转。我们把数字改一改:
| 分组 | 疗法 A | 疗法 B |
|---|---|---|
| 小结石 | 81/87 = 93% | 234/270 = 87% |
| 大结石 | 192/263 = 73% | 55/80 = 69% |
| 合计 | 273/350 = 78% | 289/350 = 83% |
现在:每个分组 A 都更高,但合计 B 反而更高! 这可能吗?
答案与解析
完全可能,而且上面就是真实论文里的数据(Charig et al., 1986)。
关键在于样本量(权重)被颠倒了:疗法 B 大量用在了容易治的小结石上(270 例),少量用在了难治的大结石(80 例);疗法 A 反之,主要集中在难治的大结石(263 例)。于是 B 被“容易病例”拉高了总体,A 被“困难病例”拖低了总体——即使它在每种难度下都更优。
合并时,原本该控制的“结石大小”这个混淆变量被混在总数里,结论就反转了。
背后的数学
这就是辛普森悖论:在分组层面成立的趋势,在汇总层面可能反转(或反之),当各组的样本量权重差异很大且分组与结果都相关时就会发生。
它的教训极其深刻:
- 看“总计”前,先问分组是否均衡;
- 相关性不等于因果——背后可能有第三个变量在捣鬼;
- 临床试验、人口普查、薪资性别差异等领域都曾栽在这个悖论上。
统计不是把数加起来那么简单,怎么分层、权重如何,直接决定你看到的是真相还是幻象。