Skip to content

统计学基础 ​

本章核心问题:数据里有事实,也有噪声——怎样描述才不失真?观察到的关系什么时候能当真(而不是随机的巧合)?回归系数显著,就等于因果关系成立了吗?

本章脉络 ​

统计学的两条源流在 19 世纪交汇。一条是误差与估计:勒让德 1805 年发表最小二乘法,高斯 (1777-1855) 随即给出正态误差理论与最优估计——「平均掉误差、逼近真值」的数理传统;另一条是社会数据:凯特勒 (1796-1874) 把正态曲线用于人的身高与犯罪率(「平均人」概念),高尔顿 (1822-1911) 研究亲子身高时发现「向均值回归」并发明相关系数,皮尔逊 (1857-1936) 把相关与卡方检验系统化。20 世纪费希尔 (1890-1962) 在农业实验中建立假设检验、方差分析与显著性传统,奈曼 (1894-1981) 与皮尔逊补上备择假设与两类错误——今日教科书的推断框架在 1930 年代已定型。

经济学的接收比想象的晚:直到 1930 年代,丁伯根 (1903-1994) 与弗里希 (1895-1973) 才把统计方法系统用于经济理论检验(两人共享首届 1969 年诺贝尔经济学奖,「计量经济学」由弗里希命名);哈维尔莫 (1911-1999) 1944 年的博士论文把概率论确立为经济计量的基础(识别问题、随机扰动进入结构方程),获 1989 年诺贝尔奖。从此,经济学完成了从「图与例」到「模型与检验」的转身——今天任何一篇实证论文,骨架都是本章:描述 → 推断 → 回归。

本章路线:描述统计(数据类型、集中趋势、离散程度、图形);推断统计(估计、假设检验、两类错误、常见检验);回归分析(简单与多元线性回归、最小二乘);最后正面回答经济学最锋利的问题——显著与因果的距离。

核心概念 ​

数据类型与描述统计 ​

定性数据描述类别(性别、行业),定量数据描述数量(收入、产量)。集中趋势:均值 xˉ=1n∑i=1nxi\bar{x} = \frac{1}{n}\sum_{i=1}^n x_i、中位数(升序排列的中间值,偶数个时取中间两值平均)、众数(出现最多)。离散程度:方差与标准差(SD(X)=Var(X)\mathrm{SD}(X) = \sqrt{\mathrm{Var}(X)})、极差 max⁡−min⁡\max - \min。图形:直方图(分区间画频数)、箱线图(中位数、四分位 Q1/Q3、极值与异常点)。

为什么均值与中位数必须成对看?因为收入这类长尾分布里,均值被右尾拉高、中位数稳在中间——「平均工资上涨而多数人没涨」的舆论争论,本质是两个汇总指标的分歧被当成事实之争。汇报规范由此而来:偏态数据报中位数(或同时报),并附离散程度;只报均值的新闻,等于把分布压扁成一个点。方差的总体与样本两式之分(1n\frac{1}{n} 与 1n−1\frac{1}{n-1})也别当成玄学:1n−1\frac{1}{n-1}(贝塞尔校正)补偿了「用样本均值代替总体均值」损失的那一个自由度,使估计无偏——自由度的账本在第 12 章约束优化里还会再见到。

估计与假设检验 ​

点估计用样本统计量估计总体参数(样本均值估总体均值);区间估计给出以指定置信水平覆盖参数的区间(置信区间)。假设检验:原假设 H0H_0(数据与假设模型一致)对备择假设 H1H_1;p 值是「在 H0H_0 为真时,得到观测或更极端数据的概率」,小于显著性水平(惯例 0.05)则拒绝 H0H_0。两类错误:第一类(真 H0H_0 被拒,误报)与第二类(假 H0H_0 未拒,漏报)。

为什么 p 值是「最常被误读的数字」?三条戒律:p 值不是「H0H_0 为真的概率」(贝叶斯后验才是);「不显著」不是「无差异」(可能是功效不足,即第二类错误);p < 0.05 不是「发现真理」,而是「值得追查」的门槛。经济学实证的放大版教训是多重检验问题:一次研究测 20 个变量,纯碰运气也会「显著」一个(1−0.9520≈64%1 - 0.95^{20} \approx 64\%)——由此滋生 p-hacking 与复现危机(2010 年代经济学大规模复现实验后,顶级期刊普遍要求预注册与多重度校正,如 Romano-Wolf 检验)。常见检验清单:t 检验(均值差异,单样本/独立/配对)、卡方检验(分类分布拟合)、方差分析 ANOVA(三组以上均值比较)——它们共享同一逻辑:统计量在 H0H_0 下的分布已知,极端即拒绝。

简单与多元线性回归 ​

模型 Y=β0+β1X+ϵY = \beta_0 + \beta_1 X + \epsilon(ϵ\epsilon 误差项),最小二乘法通过最小化残差平方和估计 β0,β1\beta_0, \beta_1;多元版 Y=β0+β1X1+⋯+βpXp+ϵY = \beta_0 + \beta_1 X_1 + \cdots + \beta_p X_p + \epsilon。用途:预测与变量关系识别。

为什么回归是实证经济学的「主武器」?因为它同时干三件事:度量(一个边际效应——XX 变一单位 YY 变多少,第 4 章导数的经验版)、控制(多元回归里 β1\beta_1 是「其他变量不变时」的效应——ceteris paribus 的可计算实现)、预测(把拟合面外推)。但它的边界同样要刻在脑门上:回归系数是条件相关,不是因果——教育年限对收入的系数混着「能力」这个漏进来的混淆变量;识别因果要靠随机实验(RCT——2019 年诺贝尔奖的领域)或准实验设计(工具变量、断点回归、双重差分——2021 年诺贝尔奖的领域)。「显著」回答的是「关系是否像噪声」,「因果」回答的是「干预 X 会不会改变 Y」——两个问题之间的鸿沟,正是当代实证方法论文献的全部主题。

问题与分析 ​

观察到的关系什么时候能当真? ​

四道关卡依次过:其一,统计显著性——系数的标准误下 t 值够大、p 值过线(否则连「相关」都立不住);其二,经济显著性——系数的量级有意义(「教育每多一年收入多 0.0001%」即便显著也无关痛痒),量级要用业务单位解读;其三,稳健性——换样本、换设定、加控制变量,结论是否还在(只在一个设定下显著的系数多半是运气);其四,识别——混淆变量、反向因果、选择偏差是否被处理。安格里斯特与因本斯(2021 年诺贝尔奖)的方法论革命可以概括为:把第四关从「恳求审稿人相信」变成「可复制的设计」。四关卡之外的诚实一课:真实研究里四关全过的结论也会因数据更新而修正——「当真」是暂时的、有置信度的当真。

幸存者偏差如何扭曲经济数据? ​

只统计「存活到抽样时刻」的个体,分母就漏掉了中途退出的——共同基金收益(失败的基金清盘消失,行业平均收益被系统性高估,学界估计每年约 0.5—1 个百分点量级,具体读数以最新研究为准)、二战返航飞机的弹孔分析(沃德教授:该加固的是没有弹孔的部位——中弹于要害的飞机根本没回来)、创业成功率研究(只数活下来的独角兽)。处理办法:以「进入样本时刻」为起点跟踪(entry cohort),让退出可见;或用 Heckman 两步法(1979)显式建模选择方程——它本身就是「为偏差付费」的回归技术。凡数据以「现状存量」而非「历史流量」登记(企业、贷款、婚姻、App 用户),先问一句:死掉的去哪了。

推导与例题 ​

例 1:最小二乘的斜率公式与解读 ​

简单回归的斜率估计:

β^1=∑i(xi−xˉ)(yi−yˉ)∑i(xi−xˉ)2=Cov(x,y)Var(x)\hat{\beta}_1 = \frac{\sum_i (x_i - \bar{x})(y_i - \bar{y})}{\sum_i (x_i - \bar{x})^2} = \frac{\mathrm{Cov}(x, y)}{\mathrm{Var}(x)}

它把「斜率」拆成两块:协方差(共动程度)除以自变量方差(标准化)。数值例:某地 10 个社区的通勤时间与幸福度调查(模拟数据),Cov=−2.4\mathrm{Cov} = -2.4,Var(x)=1.2\mathrm{Var}(x) = 1.2,则 β^1=−2\hat{\beta}_1 = -2——通勤每多一小时,幸福度得分平均低 2 分(其他条件不变)。注意解读的三要件:单位(「分/小时」)、条件(「其他变量不变」)、方向(负号)。 β^0=yˉ−β^1xˉ\hat\beta_0 = \bar{y} - \hat\beta_1\bar{x} 给出截距。分母 ∑(xi−xˉ)2\sum(x_i-\bar x)^2 大(自变量变异充分)则估计更稳——「解释变量的变异是识别的燃料」,这句话在后面工具变量一课里会变成字面真理。

例 2:一次完整的 t 检验 ​

政策评估:培训项目后处理组 25 人平均时薪 32 元、标准差 6 元;对照组 25 人 29 元、标准差 5 元。检验 H0:μ1=μ2H_0: \mu_1 = \mu_2。合并标准误:

SE=s12n1+s22n2=3625+2525=2.44≈1.56SE = \sqrt{\frac{s_1^2}{n_1} + \frac{s_2^2}{n_2}} = \sqrt{\frac{36}{25} + \frac{25}{25}} = \sqrt{2.44} \approx 1.56

t=32−291.56≈1.92t = \frac{32 - 29}{1.56} \approx 1.92,自由度 ≈48\approx 48,临界值(0.05 双侧)≈2.01\approx 2.01——∣t∣=1.92<2.01|t| = 1.92 < 2.01,不拒绝 H0H_0:差异在常规显著性水平下立不住。但经济显著性提醒:3 元/小时(约 10%)的差距不小,更可能是样本太小(功效不足,第二类错误风险高)而非「无效应」——扩样本或换更强设计(随机分配)是正确的下一步,而不是宣布「培训无用」。这个例子的全部教益:检验「不显著」时,先算功效再下结论。

局限与后续 ​

其一,正态与独立的假设常被违反:经济数据厚尾、相关、有结构突变,稳健标准误(White/HAC)、聚类标准误、自助法(bootstrap)是当代回归表的标配——「星号」的可信度取决于标准误算得对不对。其二,预测与因果的分家:机器学习方法(正则化、随机森林、深度网络)在纯预测任务上碾压线性回归并已进入经济学(替代变量的构造、异质性效应的发现),但因果解释仍靠设计而非算法——Athey 与 Imbens 的因果机器学习是这条融合线的代表。其三,大数据不自动等于好数据:选择进入样本的机制(谁用 App、谁上网评分)制造新型偏差,数字足迹的代表性问题(以最新研究为准)是测量经济学的当务之急。其四,从相关到结构:结构计量(把模型估计出来再做反事实模拟)、实验经济学(实验室与田野实验)与自然实验识别,构成了「推断因果」的三条大道——本章的最小二乘是它们共同的出发点与对照物。

以笔记整理知识,欢迎指正