核心答案:95% 置信区间 = 样本均值 ± 1.96×σ/√n;民调 ±3% 误差幅度需要约 1067 个样本,且几乎不依赖总体规模;贝叶斯定理 P(病|阳)=P(阳|病)·P(病)/P(阳)——患病率 1% 时即使检测 99% 准确,阳性者真患病概率也只有约 50%。

置信区间怎么算

结构:点估计 ± Z × 标准误

置信水平Z 值
90%1.645
95%1.96
99%2.576

例:抽样 100 人平均身高 170cm、σ=8:95% CI = 170±1.96×8/10 = 170±1.57cm。正确解读:重复抽样 100 次,约 95 次的区间包含真值——不是「真值有 95% 概率落在里面」。

误差幅度与样本量对照表

n=Z²·p(1−p)/ME²,p=0.5 时最保守:

目标误差95% 置信所需 n
±5%385
±3%1067
±2%2401
±1%9604

注意:误差减半样本要翻 4 倍;100 万人的城市与 14 亿人的国家,±3% 所需样本都是 1067——总体规模几乎不影响。

贝叶斯定理与基础率谬误

P(病|阳性) = 灵敏度×患病率 ÷ [灵敏度×患病率 + (1−特异度)×(1−患病率)]

患病率灵敏度 99%/特异度 95% 时,阳性真患病概率
10%68.8%
1%16.7%
0.1%1.9%

基础率决定一切——低患病率人群筛查,假阳性淹没真阳性。

凯利公式

最优下注比例 f*=(bp−q)/b:b=净赔率、p=胜率、q=1−p。

例:赔率 1(赢翻倍)、胜率 55%:f*=(1×0.55−0.45)/1=10%——每次押资金的 10%,长期对数增长率最大;押 20%(2 倍凯利)反而增长更慢、破产风险飙升。负期望时 f*<0:不下注。

实例:民调 ±3% 怎么来的

某民调抽样 1200 人,候选人支持率 52%:ME=1.96×√(0.52×0.48/1200)=±2.8% → 真实支持率 95% 区间 [49.2%, 54.8%]。两家候选人差距 <2 倍误差幅度时,新闻里「领先」统计上可能只是噪声。

实例:体检阳性有多慌

某癌筛查灵敏度 90%、特异度 95%,你所在人群患病率 0.5%。阳性后真患病概率:P=0.9×0.005÷(0.9×0.005+0.05×0.995)=0.0045÷0.0543≈8.3%——10 个阳性里 9 个是假警报。这不是说筛查没用,而是阳性后必须做确诊检查,别直接崩溃。

常见误区

  • 「95% 置信 = 95% 概率」:真值固定,要么在要么不在——95% 描述的是「这套方法长期命中率」。
  • 「样本要占总体 5%」:汤咸不咸尝一勺就够,不用喝 5%——1067 人对任何大城市都够用(前提是随机抽样)。
  • 「检测 99% 准,阳性就是 99% 患病」:忽略基础率是最常见统计误读——贝叶斯计算器输入三率自动出真阳概率。
  • 「凯利公式能战胜赌场」:f* 只在有正期望时有效;轮盘赌期望 −5.3%,凯利公式的输出是「别玩」。