
我们常说,用数据说话。但你有没有想过,数据也会骗人?
分组看与合并看竟会得出相反结论
20世纪70年代,英国一项研究随访了1314名女性,统计了她们的吸烟习惯与20年后存活率的关系。总体数据显示,吸烟者的死亡率反而比不吸烟者更低。看起来,吸烟似乎对健康无害。
但如果我们以65岁为界,把参与者分成年轻组和年长组,剧情就反转了。
年轻组:吸烟者死亡率为3.3%,不吸烟者死亡率为2.0%。不吸烟者死亡率更低。年长组:吸烟者死亡率为45.7%,不吸烟者死亡率为42.5%。不吸烟者死亡率还是更低。
也就是说,分组来看,不吸烟者的死亡率都更低;但整体看,反而是吸烟者的死亡率更低。
这就是典型的辛普森悖论。
所谓辛普森悖论,就是分组看和合并看会得出相反结论的反直觉现象。这种局部与整体相背离的现象,最早由英国统计学家辛普森在1951年的一篇论文中系统指出,1972年被正式命名为“辛普森悖论”。
为什么会反转
反转是怎么发生的?
吸烟组里,65岁以下的年轻人占多数;不吸烟组里,65岁及以上的年长者占多数。年龄越大,20年内的死亡风险自然越高。合并计算时并不是简单平均,而是按人数加权:吸烟组年轻人多,整体死亡率被稀释;不吸烟组年长者多,整体死亡率被推高。
在那个年代,年轻女性中吸烟者比例更高,这与社会风气、生活习惯有关。年龄影响“是否吸烟”和“20年存活率”,这种同时影响分组和结果的变量,在统计学上叫混杂变量。它正是辛普森悖论的根源。
所以,每当总体结论和分层结论方向相反时,值得问一句:是不是有什么东西在暗中引导人们进入不同的组,而这个东西恰好也影响结果?
整体并非部分的简单相加
即使分组结果和总结果一致,也不意味着没有混杂。混杂变量不一定强到能翻转结论,更多时候,它只是悄悄扭曲数据,让差距变大或变小,方向却不变。不分层,就看不见它。
而且,分一层往往不够。按年龄分层后结论一致了,那按收入、饮食、运动习惯呢?任何一个没被分层的变量,只要同时影响分组和结果,都可能成为新的混杂。所以统计学家从不说“没有混杂”,只说“控制了这些变量后,结论仍然成立”。
严格来说,辛普森悖论甚至不是悖论。它在逻辑上完全自洽,只是违背直觉。我们通常默认,整体就是部分的简单相加。但对比率而言,分组人数不同,贡献也就不同。
辛普森悖论提醒我们:数据不会主动告诉你漏掉了什么,只有追问才会。在AI越来越擅长给出答案的时代,我们比任何时候都更需要学会提出正确的问题。
(作者系华中农业大学沈婧芳名师工作室核心成员)