概率就是面积
一说概率,人们通常先想到公式——数情形、化成分数。可有一种远更直观的看法:把它看成面积。想象把所有可能的结果摊在一块板上。整块板就是样本空间,面积是 1,也就是 100%,因为无论发生什么,都必定发生在这块板上。那么任何事件就成了板上的某块区域,这个事件发生的概率,就是那块区域在板上占的面积。占一半,概率就是 0.5;占四分之一,就是 0.25。在这一幅图上,概率几乎所有的规则——并与交、对立事件、条件概率、独立——都化成了对面积的加、减、切分。不必背公式,用眼睛看面积就好。这一讲里,你会亲手画那块板,把概率当作面积来摸。
先把板做出来。所有可能结果的集合,叫样本空间,通常写作 Ω。掷两颗骰子,结果从 (1,1) 到 (6,6) 共 36 种。每一格是一个结果,既然都同样可能,每个概率就是 136。把 36 格全加起来就是 1,因为总会出点什么。可结果未必都数得清。就像在 0 与 1 之间任取一个实数,结果可以是连续的。那时我们就把样本空间不看成格子,而看成一整块区域,比如单位正方形。点标签比较这两种情形。无论可数还是连续,核心都一样:Ω 是装着所有可能结果的板,而整块板的概率永远是 1。这个"整体为 1",是一切计算的起点。
现在看事件。事件,就是我们关心的那些结果的集合——比如"两颗骰子之和为 7"。在板上,事件不过是一块区域。而这个事件发生的概率,就是那块区域在整块板里占的面积。既然我们把总面积定为 1,区域的面积就是概率。拖动角来改变事件 A 的大小。A 盖住板的一半,P(A) 就是 0.5;只盖四分之一,就是 0.25。是不是真这样,可以用点来验证。在板上随机撒许多点,落在 A 里的点的比例,就会接近 A 的面积。这就是蒙特卡洛方法,也是计算机求复杂概率的实际办法。把概率看成"面积",或"落进某区域的比例",那个抽象的数就成了看得见的面积。
事件既然是区域,那组合事件也就是组合区域。把两个事件 A 和 B 叠在一起,按按钮看看。A"或"B,即并集 A∪B,是两块区域合起来的面积。但不能把重叠部分数两遍,所以 P(A∪B) = P(A) + P(B) − P(A∩B),把重叠的部分减掉一次。A"且"B,即交集 A∩B,是两块区域重叠处的面积——两者同时发生的情形。"非"A,即对立事件 Aᶜ,是整块板去掉 A 后剩下的,所以 P(Aᶜ) = 1 − P(A)。用话说起来绕人的"或、且、非",在图上不过是把区域合起来、叠起来、抠出来。维恩图不是白来的——概率的逻辑,其实就是面积的几何。
现在是最绕人却最强大的概念:条件概率。"在已知 B 发生的前提下,A 发生的概率",写作 P(A|B)。用图看就太简单了。B 发生这个信息,把我们的整个世界缩成了 B。B 以外没发生,于是干脆把它从舞台上清走。打开开关,你会看到 B 以外变暗、板缩成 B。在这个缩小后的新世界 B 里,A 只占 A∩B 那一块。所以 P(A|B) = 面积(A∩B)面积(B),把交集除以新的整体 B。变的只是分母,从 1(整个 Ω)变成了 P(B)。条件概率,就是"把整体重新取为 B、再量一次概率"。新信息一来,就缩小样本空间重新计算——这是贝叶斯推断和一切统计学习的种子。
最后是独立。两个事件独立,意思是知道其中一个发生了,也不改变另一个的概率:P(A|B) = P(A)。B 这条信息,对 A 什么也没透露。我们用图来搭。用一条竖线把板分开,左边的条叫 A,那 P(A) 就是这条的宽。用一条横线分开,下面的条叫 B,那 P(B) 就是这条的高。拖动这两条线。A 与 B 同时发生的区域 A∩B,是左下角的长方形,它的面积是宽乘高,也就是 P(A) × P(B)。这就是独立的核心:P(A∩B) = P(A) · P(B)。乘一下就行。因为横和竖彼此毫不干涉,交集的面积就直接是两边之积。像抛两次硬币,或两个互不相关的零件出故障,一边不影响另一边时,概率就只是相乘。独立,是把概率计算用一次乘法就了结的、最叫人省心的假设。