课题:用频数表和直方图把杂乱数据变成可读的信号
一、引言:数据可视化为什么从频数分布开始?
L100 我们学了参数和统计量的区别。但在此之前,拿到一份原始数据,你第一眼看到的往往只是一堆数字。
原始数据(某基金 30 个交易日的日收益率 %): 0.8, -1.2, 0.3, 2.1, -0.5, 1.7, -2.3, 0.1, 1.5, -0.8, 0.6, 2.4, -1.5, 0.9, -0.2, 1.1, -1.8, 0.4, 2.0, -0.6, 1.3, -2.0, 0.7, 1.9, -1.1, 0.5, -0.9, 1.6, -0.3, 0.2
你能一眼看出这些数据的分布特征吗?哪里最集中?有没有极端值?对称还是偏斜? 频数分布就是解决这个问题的第一把刀。
二、核心概念
2.1 频数分布(Frequency Distribution)
定义: 将数据按区间分组,统计每个区间内观测值个数的一种表格化呈现方式。
| 要素 | 说明 |
|---|---|
| 原始数据 | 未经处理的观测值序列 |
| 区间(Bin/Class) | 人为划分的数据范围 |
| 频数(Frequency) | 落入该区间的观测值个数 |
| 相对频数(Relative Frequency) | 频数 / 总观测数 |
| 累积频数(Cumulative Frequency) | 截至当前区间的累计频数 |
记住三句话
| # | 金句 |
|---|---|
| 1 | 频数分布是把数据「分组打包」,让你一眼看到数据的形状。 |
| 2 | 等宽区间看高度,不等宽区间看面积。混淆这一点 = 送分题变成送命题。 |
| 3 | 金融收益率普遍尖峰厚尾。用正态分布建模就是在系统性低估风险。 |
下一课 L102:我们将深入探讨偏度与峰度的量化计算,以及它们在投资组合风险管理中的应用。
imodal (two sub-populations mixed)? | | 3 | Tails | Any isolated, distant bars (outliers)? |
Three Key Takeaways
| # | Golden Rule |
|---|---|
| 1 | A frequency distribution "packs" data into groups so you can see its shape at a glance. |
| 2 | Equal-width intervals: look at height. Unequal-width: look at area. Confusing these turns a gimme into a trap. |
| 3 | Financial returns are generally leptokurtic with fat tails. Modeling them with the normal distribution systematically underestimates risk. |
Next lesson L102: We will dive deeper into the quantitative calculation of skewness and kurtosis, and their applications in portfolio risk management.