核心答案:数据 1, 2, 2, 3, 100——平均数 21.6(被 100 拉高失真)、中位数 2(排序后居中)、众数 2(出现 2 次)。描述「典型水平」时,有极端值选中位数,数据均匀选平均数。
三个概念定义
| 指标 | 算法 | 特点 |
|---|---|---|
| 平均数(mean) | 总和 ÷ 个数 | 用全部数据,怕极端值 |
| 中位数(median) | 排序后中间那个(偶数个取中间两数均值) | 抗极端值 |
| 众数(mode) | 出现次数最多的值 | 可不存在或不唯一 |
计算实例对比
数据:5 名员工月薪 4000, 4500, 5000, 5500, 50000(含老板)
- 平均数 = 69000 ÷ 5 = 13800——对外宣称「平均月薪 1.38 万」严重误导
- 中位数 = 排序后第 3 个 = 5000——普通员工真实水平
- 众数 = 无重复值,众数不存在
偶数个数据:1, 3, 5, 8 的中位数 = (3+5) ÷ 2 = 4。
众数实例:鞋店统计销量 38 码 12 双、39 码 20 双、40 码 15 双——众数 39 码,进货按众数备货,平均码数没意义。
什么时候用哪个
| 场景 | 推荐 | 原因 |
|---|---|---|
| 收入、房价 | 中位数 | 少数富豪会拉高平均数 |
| 考试分数分析 | 平均数 + 中位数 | 两者差距揭示分数分布偏斜 |
| 销量/尺码 | 众数 | 分类数据无平均值概念 |
| 科学测量 | 平均数 | 误差对称分布,均值最准 |
| 比赛评分 | 去尾平均数 | 去掉最高最低分再平均 |
统计局为什么爱报「人均可支配收入中位数」:2023 年全国居民人均可支配收入 39218 元,中位数 33036 元——中位数更低更真实,因为高收入群体拉高了均值。
加权平均数
各项重要程度不同时用加权平均:Σ(值 × 权重) ÷ Σ权重。
实例:课程总评 = 平时 30% + 期中 30% + 期末 40%。平时 90、期中 80、期末 85:总评 = 90×0.3 + 80×0.3 + 85×0.4 = 27 + 24 + 34 = 85。
GPA:(Σ 绩点 × 学分) ÷ 总学分——4 学分课的 A(4.0)比 2 学分课的 A 更能拉高 GPA。
常见误区
- 「平均数代表大多数人」:偏态分布下(收入、房价),平均数常高于 60%-70% 的个体。看新闻先问:是均值还是中位数
- 中位数不用排序直接取中间:必须先排序!数据 5, 1, 9, 3, 7 的中位数是排序后的 5,不是原位置的 9
- 众数必有且唯一:可能不存在(无重复值)或多个(2, 2, 5, 5, 8 的众数是 2 和 5)
- 分组数据直接平均:各班平均分直接平均 ≠ 全年级平均分,必须按人数加权