核心答案:标准差衡量数据离散程度:先算均值,再算每个数与均值差的平方,求平均得方差,开根号即标准差。数据 2,4,4,4,5,5,7,9:均值 5,方差 4,标准差 = 2

标准差是什么

  • 均值告诉你数据中心在哪
  • 标准差告诉你数据围绕中心散得多开
  • 标准差越大波动越大:两个班平均分都 80,标准差 5 的班成绩整齐,标准差 15 的班两极分化

手算完整实例

数据:2, 4, 4, 4, 5, 5, 7, 9(总体)

  1. 均值 = 40÷8 = 5
  2. 离均差:−3, −1, −1, −1, 0, 0, +2, +4
  3. 平方:9, 1, 1, 1, 0, 0, 4, 16 → 和 = 32
  4. 方差 = 32÷8 = 4
  5. 标准差 = √4 = 2

总体 vs 样本(n 还是 n−1)

场景分母上例方差
总体(所有数据都在手)n32÷8 = 4
样本(从总体抽样估计)n−132÷7 ≈ 4.57

为什么 n−1:样本均值总比真实均值「更贴近」样本自身,导致离差平方和系统性偏小,除以 n−1(贝塞尔校正)抵消偏差。

软件口径:Excel STDEV.P(总体)、STDEV.S(样本);Python numpy 默认 ddof=0(总体),pandas 默认 ddof=1(样本)。

68-95-99.7 法则

正态分布下:

  • 68% 数据落在 均值±1σ
  • 95% 落在 ±2σ
  • 99.7% 落在 ±3σ

实例:某班成绩均值 75、标准差 8(近似正态):

  • 67-83 分约占 68%
  • 59-91 分约占 95%
  • 超过 99 分或低于 51 分的是千分之三的极端值

应用场景

  1. 质量管控:零件尺寸 10.00±0.05mm,标准差 0.01 → 超差品率可估
  2. 金融风险:基金年化波动率(日收益标准差×√252)衡量风险
  3. 教育测量:标准分 z = (x−均值)÷σ,不同科目成绩可比
  4. 异常检测:|z| > 3 的数据点值得复核

常见误区

  • 方差当标准差用:方差单位是原单位的平方(cm²),说「身高标准差 25cm²」是病句,开根号后 5cm 才对
  • 样本除以 n:抽样调查除以 n 会低估真实离散度,必须 n−1
  • 非正态硬套 68-95-99.7:该法则只对正态分布成立,收入、房价等偏态分布不适用
  • 「标准差小就是好」:看场景——投资里标准差小是稳健,创新业务里标准差大才可能有爆发