seegongsik
我的单词本
工程数学

分布就是概率的散布

离散是 PMF 柱,连续以曲线下面积为概率,样本↑收敛到密度,CDF 是累积

上一讲我们说概率就是面积。可只谈单个事件的概率,只是图的一半。真正想知道的是:哪些值出现得多频繁,概率是怎样散布在那些可能的值上的。这散布的整体形状,就是分布。两颗骰子之和,7 附近常出,2 或 12 罕见。这张"常与罕"的整体地图就是分布,画成柱状图就能看到一个峰。值是离散、彼此隔开的,每根柱就是一个概率;值是连续的,柱子就变得无限密集,化成一条光滑的曲线——密度。这里有决定性的一点。在连续分布里,曲线的高度不是概率,曲线下方的面积才是概率。E1 的"面积 = 概率"原样延续下来。这一讲里,你会把分布从柱子画到曲线、再画到面积,用眼睛记住概率是怎样散开的。

先看值彼此隔开的离散分布。一颗骰子,1 到 6 各 16,六根柱子一样高地并排。可看两颗骰子之和,形状就骤然不同。和为 7 的有 (1,6)(2,5)(3,4)(4,3)(5,2)(6,1) 六种,和为 2 的只有 (1,1) 一种。于是 7 高达 636,2 和 12 低到 136——一个中间鼓起的三角形。每根柱的高度,就是那个值出现的概率,这叫概率质量函数,PMF。点柱子看看每个值的概率。关键在于:把所有柱高加起来正好是 1,因为总会出某个值。分布,正是"如何把总概率 1 分配到各个可能的值上"。

值是连续的会怎样?像身高、体重、测量误差那样,结果毫无间断地连成一片时。这时一根根数柱子毫无意义,因为恰好是 173.4825...cm 的概率,实际上是 0。我们改为收集样本,按区间归并,画成直方图。用滑块增大样本数 N。N 小时,柱子参差不齐、粗糙;可 N 越大,偶然的起伏被平均掉、消失,柱子的轮廓越来越接近一条光滑的曲线。这条曲线就是概率密度函数。直方图是有限样本的近似,而把样本收集到无穷多时的理想形状,正是密度曲线。所以密度曲线就是"值连续时的 PMF",是把柱子切到无限细再连起来的光滑版本。数据收得越多,藏在数据背后的真正分布就越显露出来。

怎么从密度曲线读出概率?这正是人们最容易糊涂的地方。曲线的高度不是概率——在连续情形里,单个点的概率是 0。概率要读成曲线下方的面积。"X 落在 a 与 b 之间的概率",就是从 a 到 b 曲线下方的面积。拖动两个边界 a 与 b,把它们之间的区间拉宽。面积一大,那个概率也跟着大。包含峰下高高的中段,同样的宽度面积就大;尾部平坦处,宽度相同面积却小——所以中间的值出现得更频繁。整条曲线下方的面积恰好是 1,就像 E1 里整块板是 1 一样。归根结底,连续分布的概率就是量面积,也就是积分。微积分里的积分,在概率里就是这么用的。

分布按其散布的形状分门别类,每种形状都有对得上的情形。用标签看三种代表分布。均匀分布是一条平平的长方形曲线。当固定区间内处处等可能时它就合适——比如计算机生成的随机数,或舍入误差。指数分布起头最高,往右骤然下落。它出现在到下一次事件的等待时间、零件到故障的时间、顾客到达的间隔——这些"短等常见、长等罕见"的情形。正态分布就是那著名的钟形,中间最高、左右对称地平滑下落。身高、考试分数、测量误差——几乎一切由许多小因素相加而成的自然散布,都是这个形状。知道了分布的形状,就能提前估出数据会怎么表现。

最后,还有一幅与密度配对的图:累积分布函数,CDF。如果说密度展示的是"概率在每个值附近聚了多少",那 CDF 展示的就是"取到小于或等于 x 的值的概率"——从最左端一路堆到 x 的累积概率。看图就明白。上面是密度曲线,下面是 CDF。拖动 x,上面会把到 x 的面积涂上,下面则把那个面积值标成一个点。也就是说,CDF(x) 正是密度曲线下方到 x 的面积。把 x 从最左移到最右,你会把面积越扫越多,于是 CDF 从 0 起步、升到 1,一次也不下降。在密度峰高的区间,CDF 升得陡;在尾部,升得缓。这两条曲线是一对,是同一个分布的两种看法:密度是斜率,CDF 是把那斜率累积成的面积。微分与积分的关系,在这儿也照样成立。

实际应用分布,是概率如何散布在各个可能值上的整体形状。离散就用概率质量函数(PMF)的柱子,每根柱高是那个值的概率,合为 1。连续就用概率密度函数,是曲线下方的面积、而非高度才是概率,所以 P(a≤X≤b) 是区间的面积,总面积是 1。样本收得多了,直方图就收敛到密度曲线。代表分布有均匀(区间内均匀)、指数(等待时间与故障)、正态(许多因素之和、钟形)。CDF 是堆到 x 的累积概率=密度下方到 x 的面积,从 0 单调升到 1,与密度是积分与微分的关系。在工程里,这是可靠性(故障时间分布)、质量管理(工序散差)、信号噪声、通信误码率、库存与排队设计的语言。测量值总有散差,所以不以单个数、而以分布来思考,正是工程思维的核心。下一讲,我们转向用两个数概括分布——期望与方差,即重心与散布。
工程数学
如果有帮助,请支持我们