明暗
统计学基础
本章核心问题:数据里有事实,也有噪声——怎样描述才不失真?观察到的关系什么时候能当真(而不是随机的巧合)?回归系数显著,就等于因果关系成立了吗?
本章脉络
统计学的两条源流在 19 世纪交汇。一条是误差与估计:勒让德 1805 年发表最小二乘法,高斯 (1777-1855) 随即给出正态误差理论与最优估计——「平均掉误差、逼近真值」的数理传统;另一条是社会数据:凯特勒 (1796-1874) 把正态曲线用于人的身高与犯罪率(「平均人」概念),高尔顿 (1822-1911) 研究亲子身高时发现「向均值回归」并发明相关系数,皮尔逊 (1857-1936) 把相关与卡方检验系统化。20 世纪费希尔 (1890-1962) 在农业实验中建立假设检验、方差分析与显著性传统,奈曼 (1894-1981) 与皮尔逊补上备择假设与两类错误——今日教科书的推断框架在 1930 年代已定型。
经济学的接收比想象的晚:直到 1930 年代,丁伯根 (1903-1994) 与弗里希 (1895-1973) 才把统计方法系统用于经济理论检验(两人共享首届 1969 年诺贝尔经济学奖,「计量经济学」由弗里希命名);哈维尔莫 (1911-1999) 1944 年的博士论文把概率论确立为经济计量的基础(识别问题、随机扰动进入结构方程),获 1989 年诺贝尔奖。从此,经济学完成了从「图与例」到「模型与检验」的转身——今天任何一篇实证论文,骨架都是本章:描述 → 推断 → 回归。
本章路线:描述统计(数据类型、集中趋势、离散程度、图形);推断统计(估计、假设检验、两类错误、常见检验);回归分析(简单与多元线性回归、最小二乘);最后正面回答经济学最锋利的问题——显著与因果的距离。
核心概念
数据类型与描述统计
定性数据描述类别(性别、行业),定量数据描述数量(收入、产量)。集中趋势:均值 、中位数(升序排列的中间值,偶数个时取中间两值平均)、众数(出现最多)。离散程度:方差与标准差()、极差 。图形:直方图(分区间画频数)、箱线图(中位数、四分位 Q1/Q3、极值与异常点)。
为什么均值与中位数必须成对看?因为收入这类长尾分布里,均值被右尾拉高、中位数稳在中间——「平均工资上涨而多数人没涨」的舆论争论,本质是两个汇总指标的分歧被当成事实之争。汇报规范由此而来:偏态数据报中位数(或同时报),并附离散程度;只报均值的新闻,等于把分布压扁成一个点。方差的总体与样本两式之分( 与 )也别当成玄学:(贝塞尔校正)补偿了「用样本均值代替总体均值」损失的那一个自由度,使估计无偏——自由度的账本在第 12 章约束优化里还会再见到。
估计与假设检验
点估计用样本统计量估计总体参数(样本均值估总体均值);区间估计给出以指定置信水平覆盖参数的区间(置信区间)。假设检验:原假设 (数据与假设模型一致)对备择假设 ;p 值是「在 为真时,得到观测或更极端数据的概率」,小于显著性水平(惯例 0.05)则拒绝 。两类错误:第一类(真 被拒,误报)与第二类(假 未拒,漏报)。
为什么 p 值是「最常被误读的数字」?三条戒律:p 值不是「 为真的概率」(贝叶斯后验才是);「不显著」不是「无差异」(可能是功效不足,即第二类错误);p < 0.05 不是「发现真理」,而是「值得追查」的门槛。经济学实证的放大版教训是多重检验问题:一次研究测 20 个变量,纯碰运气也会「显著」一个()——由此滋生 p-hacking 与复现危机(2010 年代经济学大规模复现实验后,顶级期刊普遍要求预注册与多重度校正,如 Romano-Wolf 检验)。常见检验清单:t 检验(均值差异,单样本/独立/配对)、卡方检验(分类分布拟合)、方差分析 ANOVA(三组以上均值比较)——它们共享同一逻辑:统计量在 下的分布已知,极端即拒绝。
简单与多元线性回归
模型 ( 误差项),最小二乘法通过最小化残差平方和估计 ;多元版 。用途:预测与变量关系识别。
为什么回归是实证经济学的「主武器」?因为它同时干三件事:度量(一个边际效应—— 变一单位 变多少,第 4 章导数的经验版)、控制(多元回归里 是「其他变量不变时」的效应——ceteris paribus 的可计算实现)、预测(把拟合面外推)。但它的边界同样要刻在脑门上:回归系数是条件相关,不是因果——教育年限对收入的系数混着「能力」这个漏进来的混淆变量;识别因果要靠随机实验(RCT——2019 年诺贝尔奖的领域)或准实验设计(工具变量、断点回归、双重差分——2021 年诺贝尔奖的领域)。「显著」回答的是「关系是否像噪声」,「因果」回答的是「干预 X 会不会改变 Y」——两个问题之间的鸿沟,正是当代实证方法论文献的全部主题。
问题与分析
观察到的关系什么时候能当真?
四道关卡依次过:其一,统计显著性——系数的标准误下 t 值够大、p 值过线(否则连「相关」都立不住);其二,经济显著性——系数的量级有意义(「教育每多一年收入多 0.0001%」即便显著也无关痛痒),量级要用业务单位解读;其三,稳健性——换样本、换设定、加控制变量,结论是否还在(只在一个设定下显著的系数多半是运气);其四,识别——混淆变量、反向因果、选择偏差是否被处理。安格里斯特与因本斯(2021 年诺贝尔奖)的方法论革命可以概括为:把第四关从「恳求审稿人相信」变成「可复制的设计」。四关卡之外的诚实一课:真实研究里四关全过的结论也会因数据更新而修正——「当真」是暂时的、有置信度的当真。
幸存者偏差如何扭曲经济数据?
只统计「存活到抽样时刻」的个体,分母就漏掉了中途退出的——共同基金收益(失败的基金清盘消失,行业平均收益被系统性高估,学界估计每年约 0.5—1 个百分点量级,具体读数以最新研究为准)、二战返航飞机的弹孔分析(沃德教授:该加固的是没有弹孔的部位——中弹于要害的飞机根本没回来)、创业成功率研究(只数活下来的独角兽)。处理办法:以「进入样本时刻」为起点跟踪(entry cohort),让退出可见;或用 Heckman 两步法(1979)显式建模选择方程——它本身就是「为偏差付费」的回归技术。凡数据以「现状存量」而非「历史流量」登记(企业、贷款、婚姻、App 用户),先问一句:死掉的去哪了。
推导与例题
例 1:最小二乘的斜率公式与解读
简单回归的斜率估计:
它把「斜率」拆成两块:协方差(共动程度)除以自变量方差(标准化)。数值例:某地 10 个社区的通勤时间与幸福度调查(模拟数据),,,则 ——通勤每多一小时,幸福度得分平均低 2 分(其他条件不变)。注意解读的三要件:单位(「分/小时」)、条件(「其他变量不变」)、方向(负号)。 给出截距。分母 大(自变量变异充分)则估计更稳——「解释变量的变异是识别的燃料」,这句话在后面工具变量一课里会变成字面真理。
例 2:一次完整的 t 检验
政策评估:培训项目后处理组 25 人平均时薪 32 元、标准差 6 元;对照组 25 人 29 元、标准差 5 元。检验 。合并标准误:
,自由度 ,临界值(0.05 双侧)——,不拒绝 :差异在常规显著性水平下立不住。但经济显著性提醒:3 元/小时(约 10%)的差距不小,更可能是样本太小(功效不足,第二类错误风险高)而非「无效应」——扩样本或换更强设计(随机分配)是正确的下一步,而不是宣布「培训无用」。这个例子的全部教益:检验「不显著」时,先算功效再下结论。
局限与后续
其一,正态与独立的假设常被违反:经济数据厚尾、相关、有结构突变,稳健标准误(White/HAC)、聚类标准误、自助法(bootstrap)是当代回归表的标配——「星号」的可信度取决于标准误算得对不对。其二,预测与因果的分家:机器学习方法(正则化、随机森林、深度网络)在纯预测任务上碾压线性回归并已进入经济学(替代变量的构造、异质性效应的发现),但因果解释仍靠设计而非算法——Athey 与 Imbens 的因果机器学习是这条融合线的代表。其三,大数据不自动等于好数据:选择进入样本的机制(谁用 App、谁上网评分)制造新型偏差,数字足迹的代表性问题(以最新研究为准)是测量经济学的当务之急。其四,从相关到结构:结构计量(把模型估计出来再做反事实模拟)、实验经济学(实验室与田野实验)与自然实验识别,构成了「推断因果」的三条大道——本章的最小二乘是它们共同的出发点与对照物。