seegongsik
我的单词本
概率与统计

从样本算出的量本身也是随机的

每个样本算出的均值都略有不同,其分布就是抽样分布。样本均值的标准误为 σ/√n,样本越大越窄。得益于中心极限定理,即使总体非正态,样本均值也趋于钟形。

抽一个样本、求它的平均,就得到一个数。换一个样本,就得到另一个数。也就是说,从样本算出的统计量,这里是样本均值本身,是每次抽样都在跳动的随机变量。这种跳动也有规律。样本均值可能取到的那些值的分布,叫做抽样分布,而这个分布的宽度叫做标准误。如果说工程数学的 normal-clt 让你看到把许多值相加会变成钟形,那么这里我们问一个更尖锐的问题:均值本身在样本之间散得有多开,以及样本增大时这份散布如何缩小。关键公式只有一个:标准误等于 σ 除以 √n。这一行就能解释:为什么民意调查只问几千人就够,为什么实验要重复许多次,以及每个估计值旁边那个 ± 是从哪里来的。

按下按钮,重新抽一个样本。即便每个样本都来自同一总体、大小同为 n,它的均值 x̄ 每次也略有不同。抽一次是一个点,再抽一次又是一个点,就这样把样本均值不断堆进直方图,起初参差不齐,渐渐落定成一个中间鼓起的小丘。这个越堆越高的分布,正是抽样分布,是样本均值这个统计量为自己画出的分布。要点在于:我们要测的对象(总体均值)是固定的,而用来估计它的工具(样本均值)却在摇摆。弄清这份摇摆的形状与宽度,就是本讲的全部。

现在把两个分布并排看。宽宽铺开的灰色,是单个原始数据散布的样子,它的宽度就是总体标准差 σ。在它上方细细耸起的蓝色分布,是大小为 n 的样本均值散布的样子,紧紧地向中央聚拢。因为求平均时大值和小值互相抵消,均值比任何单个值都稳得多。这个窄窄的宽度就是标准误,它虽和标准差 σ 名字相近,却是完全不同的量:σ 讲的是个体之间差多少,标准误讲的是这些个体的平均有多不可靠。拖动 n 增大,看灰色纹丝不动,而只有蓝色越来越窄。

现在用一个精确的公式把这份宽度钉牢:标准误等于 σ 除以 √n。要害在于分母里是 √n,而不是 n 本身。拖动 n 增大,标准误沿曲线下滑,起初陡降,越往后越平缓。要把标准误减半,得把 n 增到四倍;要把误差降到十分之一,得多收集一百倍的样本。正因这道 √n 的墙,越想提高精度,代价越大。所以过了某个点,改进测量本身,胜过再多收样本。数据当然越多越好,但明白这份回报只按 √n 的速度增长,才是实战的判断力。

到此为止总体一直是钟形,可以说我们手下留情了。那要是一个明摆着偏向一侧的分布呢?这里的指数分布挤在 0 附近,向右拖着一条长尾,一点也不对称。n 等于 1 时,样本均值的分布就是这偏斜的原样。可一旦拖动 n 增大,惊人的事发生了。无论源多么扭曲,样本均值的分布都稳步趋向左右对称的钟形,恰好贴合金色的正态曲线。这就是中心极限定理在抽样分布上的样子。若说 normal-clt 让你看到把值相加会成钟,那么这里你看到的是:把那个和除以 n 得到的均值,其分布无论原样如何,都收敛到 N(μ, σ/√n)。所以即使不知道总体的形状,单单样本均值也能当作正态来处理。

最后,把样本大小对抽样分布的作用直接叠起来看。灰色是小样本(n=4)的均值分布,铺得很宽。蓝色是你用滑块设定的大 n 的均值分布。n 越往上推,蓝色就越高越窄地耸起,向真均值周围收拢。两个分布的中心都在同一个 μ 上重合,只有宽度按 σ/√n 的速度缩小。这在实战中的含义很明确:样本越大,我们的估计值就越常落在离真值更近的地方,也就是估计越精确。民意调查、临床试验、质量抽检增大样本量,正是为了这幅图。不过正如第 3 讲所示,这份回报只按 √n 增长,所以到底缩到多窄才够,总要和成本权衡。

实际应用从样本算出的统计量,本身就是随机变量。样本均值 x̄ 随样本而摇摆,这份摇摆的分布就是抽样分布。它的中心还是总体均值 μ,可宽度远比单个标准差 σ 窄,而这宽度正是标准误 σ/√n。因为分母里是 √n,要把误差减半,就得把样本增到四倍。多亏中心极限定理,无论总体多偏,只要 n 大,样本均值的分布都收敛到钟形 N(μ, σ/√n)。所以哪怕只有一个样本,我们也能定量地说:真值就落在 x̄ 附近 ± 几个 σ/√n 之内。这是民调抽样误差、实验误差棒、质量控制、置信区间共同的骨架。统计说到底,就是给一个估计有多不可靠标上数字,而那个数字就是标准误。
概率与统计
如果有帮助,请支持我们