核心答案:95% 置信区间 = 样本均值 ± 1.96×σ/√n;民调 ±3% 误差幅度需要约 1067 个样本,且几乎不依赖总体规模;贝叶斯定理 P(病|阳)=P(阳|病)·P(病)/P(阳)——患病率 1% 时即使检测 99% 准确,阳性者真患病概率也只有约 50%。
置信区间怎么算
结构:点估计 ± Z × 标准误。
| 置信水平 | Z 值 |
|---|---|
| 90% | 1.645 |
| 95% | 1.96 |
| 99% | 2.576 |
例:抽样 100 人平均身高 170cm、σ=8:95% CI = 170±1.96×8/10 = 170±1.57cm。正确解读:重复抽样 100 次,约 95 次的区间包含真值——不是「真值有 95% 概率落在里面」。
误差幅度与样本量对照表
n=Z²·p(1−p)/ME²,p=0.5 时最保守:
| 目标误差 | 95% 置信所需 n |
|---|---|
| ±5% | 385 |
| ±3% | 1067 |
| ±2% | 2401 |
| ±1% | 9604 |
注意:误差减半样本要翻 4 倍;100 万人的城市与 14 亿人的国家,±3% 所需样本都是 1067——总体规模几乎不影响。
贝叶斯定理与基础率谬误
P(病|阳性) = 灵敏度×患病率 ÷ [灵敏度×患病率 + (1−特异度)×(1−患病率)]
| 患病率 | 灵敏度 99%/特异度 95% 时,阳性真患病概率 |
|---|---|
| 10% | 68.8% |
| 1% | 16.7% |
| 0.1% | 1.9% |
基础率决定一切——低患病率人群筛查,假阳性淹没真阳性。
凯利公式
最优下注比例 f*=(bp−q)/b:b=净赔率、p=胜率、q=1−p。
例:赔率 1(赢翻倍)、胜率 55%:f*=(1×0.55−0.45)/1=10%——每次押资金的 10%,长期对数增长率最大;押 20%(2 倍凯利)反而增长更慢、破产风险飙升。负期望时 f*<0:不下注。
实例:民调 ±3% 怎么来的
某民调抽样 1200 人,候选人支持率 52%:ME=1.96×√(0.52×0.48/1200)=±2.8% → 真实支持率 95% 区间 [49.2%, 54.8%]。两家候选人差距 <2 倍误差幅度时,新闻里「领先」统计上可能只是噪声。
实例:体检阳性有多慌
某癌筛查灵敏度 90%、特异度 95%,你所在人群患病率 0.5%。阳性后真患病概率:P=0.9×0.005÷(0.9×0.005+0.05×0.995)=0.0045÷0.0543≈8.3%——10 个阳性里 9 个是假警报。这不是说筛查没用,而是阳性后必须做确诊检查,别直接崩溃。
常见误区
- 「95% 置信 = 95% 概率」:真值固定,要么在要么不在——95% 描述的是「这套方法长期命中率」。
- 「样本要占总体 5%」:汤咸不咸尝一勺就够,不用喝 5%——1067 人对任何大城市都够用(前提是随机抽样)。
- 「检测 99% 准,阳性就是 99% 患病」:忽略基础率是最常见统计误读——贝叶斯计算器输入三率自动出真阳概率。
- 「凯利公式能战胜赌场」:f* 只在有正期望时有效;轮盘赌期望 −5.3%,凯利公式的输出是「别玩」。