均值之外的第二个重要统计量是方差,可以衡量一个分布的离散程度,也就是数据与均值之间距离的平方的平均值。 1 如果分布中的每个点具有相同的值,那么方差等于零。如果一半数据的值为4,一半的值为10,那么平均来说,每个点与均值的距离为3、方差等于9。分布的标准差是另一个常用的统计量,等于方差的平方根。
可能的分布集合是无限的。我们可以在纸上任意画出一条线并将它解释为概率分布。幸运的是,我们经常遇到的分布一般都属于有限的几种类型。最常见的分布就是正态分布,也就是钟形曲线,如图5-1所示。
图5-1 正态分布及其标准差
正态分布的均值是对称的。如果一个正态分布的均值等于零,那么抽取到大于3的概率等于抽取到小于-3的概率。正态分布的特征在于其均值和标准差(或者等价地,其方差)。也就是说,所有正态分布的图形看上去都是相似的,大约68%的结果在均值的一个标准差内,大约95%的结果在两个标准差内,并且超过99%的结果在三个标准差内。正态分布允许任何大小的结果或事件,不过“大”事件是非常罕见的,与均值距离超过五个标准差的事件发生的概率为200万分之一。
我们可以利用正态分布的规律给各种范围的结果分配概率。如果位于美国威斯康星州密尔沃基市房子的平均面积是2 000平方英尺(1平方英尺≈0.09平方米)、标准差为500平方英尺,那么那里68%的房子面积介于1 500平方英尺到2 500平方英尺之间,95%的房子面积介于1 000平方英尺到3 000平方英尺之间。如果2019年的福特福克斯汽车平均每加仑(1加仑≈3.79升)汽油可以行驶40英里(1英里≈1.6千米),且标准差为每加仑1英里,那么超过99%的福特福克斯汽车每加仑汽油可以行驶37英里至43英里。尽管消费者希望自己的汽车越省油越好,但是一般来说不可能每加仑汽油行驶80英里。
逻辑:中心极限定理
非常多的现象都表现为正态分布:动物和植物的体型大小,学生在考试中的成绩,便利店每天的销售额,海胆的寿命,等等。中心极限定理表明为什么对随机变量求和或取均值会产生正态分布。
中心极限定理
只要各随机变量是相互独立的,每个随机变量的方差都是有限的,且没有任何一小部分随机变量贡献了大部分变差,那N ≥20个随机变量的和就近似一个正态分布。 2
中心极限定理一个非常重要的特征是,随机变量本身不一定是正态分布的。它们可以有任何分布,只要每一个随机变量都具有有限的方差,并且它们中的任何一小部分随机变量都不贡献大部分方差。假设,在一个500人的小城镇中,人们的购买行为数据显示,每个人平均每个星期花费100美元。在这些人中,可能有些人这个星期只花50美元、下个星期则花150美元,另一部分人可能每3个星期花费300美元。而其他人则可能每个星期的花费在20至180美元之间。只要每个人的支出都只有有限的变差并且没有任何一小部分人贡献了大部分变差,那么分布的总和必定是一个正态分布,其均值为50 000美元。每个星期的总支出也将是对称的:可能高于55 000美元,也可能低于45 000美元。根据同样的逻辑,人们购买的香蕉、牛奶以及炸玉米饼的数量也都是正态分布的。
我们还可以应用中心极限定理来解释人类身高的正态分布。一个人的身高取决于基因、环境以及两者之间的相互作用。基因的贡献率可能高达80%,因此不妨假设身高只取决于基因。研究表明,至少180个基因有助于人体长高。 3 例如,一个基因可能有助于长出较长的颈部或头部,另一个基因可能有助于长出更长的胫骨。虽然基因之间存在相互作用,但我们可以假设在“长高”这件事情上,每个基因都是相互独立的。如果身高等于180个基因贡献的总和,那么身高将呈现正态分布。相同的逻辑可以证明,狼的体重和大熊猫的拇指长度也是如此。
功能:应用分布知识
我们对正态分布的第一个应用将揭示:为什么罕见结果在规模小的群体中更常见,为什么最好的学校往往规模较小,为什么癌症发病率最高的郡县人口较少。回想一下,在一个正态分布中,95%的结果位于两个标准偏差内,99%的结果位于三个标准偏差内,根据中心极限定理,一组独立随机变量的均值将是正态分布的(当然方差要满足前述要求)。由此可见,我们可以非常确信:考试分数的总体平均值也将是正态分布的。然而,随机变量平均值的标准差并不等于变量标准差的平均值,而且总和的标准差也不等于标准差的总和。相反,这些关系取决于总体大小的平方根。
平方根法则(The square root rules)
N 个相互独立的随机变量,都具有标准差σ ,对这些随机变量的值的标准差σ μ 和对这些随机变量总和的标准差σ Σ ,分别由以下公式给出: 4
均值的标准差公式表明,大的总体的标准差要比小的总体的标准差低得多。由此可以推断,在小的群体中应该会观察到更多的好事和更多的坏事。事实上我们确实观察到了:最安全的居住地是小城镇,但最不安全的地方也是小城镇;肥胖率和癌症发病率最高的那些郡县的人口较少。这些事实都可以通过标准差的差异来解释。
如果不考虑样本量,直接根据离群值(异常值)推断因果关系可能会导致相当糟糕的政策行为。出自这个原因,美国统计学家霍华德·魏纳(Howard Wainer)将均值标准差公式称为“世界上最危险的方程式”。例如,在20世纪90年代,盖茨基金会和其他一些非营利机构以“最好的学校都是小学校”为依据,倡导将大学校分拆为小学校。 5 为了揭示这种推理的逻辑缺陷,试想一下,现在有两所学校,一所是只有100名学生的小学校,另一所是有1 600名学生的大学校,并假设这两所学校学生的成绩均来自相同的分布,平均分为100,标准差为80。在小学校中,平均值的标准差等于8,即学生成绩的标准差80除以学生人数的平方根10。而在大学校中,平均值的标准差则等于2。
如果以平均分为标准,把那些平均成绩在110以上的学校称为“优秀”,把平均成绩在120以上的学校称为“非常优秀”,那么将只有小学校才有可能达到这个标准。对于小学校而言,平均成绩为110时,只比总体均值高出了1.25个标准差,这类事件发生的概率大约为10%。而平均成绩为120时,则比总体均值高出了2.5个标准差,这类事件大约150所学校发生一次。对大学校进行相同的计算时,我们却会发现“优秀”阈值意味着比均值高5个标准差,而“非常优秀”阈值则比均值高10个标准差!实际上这类事件永远不会发生。因此,最好的那些学校普遍规模较小这个“事实”并不能证明小学校的表现更好。即便学校规模本身完全没有影响,“最好的学校都很小”这种事情也会发生,因为平方根法则会起作用。
检验显著性
我们还可以利用正态分布的规律来检验各种平均值的显著性差异。如果经验均值与假设均值之间的偏差了超过两个标准差,那么社会科学家就会拒绝这两种均值相同的假设。 6 现在提出这样一个假设,即巴尔的摩的通勤时间与洛杉矶的通勤时间相同。假设数据表明,巴尔的摩的通勤时间平均为33分钟,而洛杉矶为34分钟。如果这两个数据集的均值标准差都是1分钟,那么我们就不能拒绝巴尔的摩和洛杉矶两地通勤时间相同的假设。虽然二者的均值不同,但只存在1个标准差。如果洛杉矶的平均通勤时间为37分钟,那么我们就会拒绝这个假设,因为均值之间相差4个标准偏差。
但是,物理学家可能不会拒绝这样的假设,至少当数据来自物理实验时不会。物理学家采用更严格的标准,因为他们拥有更大的数据集(原子的数量远远超过了人的数量),数据也更“干净”。物理学家在2012年证明希格斯玻色子(Higgs boson)存在时所依据的证据,在700万次试验中随机出现不到一次。
美国食品药品监督管理局(FDA)所使用的药物批准程序也包含了显著性检验。如果一家制药公司声称自己研发的某种新药可以减轻湿疹的严重程度,那么这家公司就必须进行两项随机对照试验。为了构建一项随机对照试验,该公司组织了两个相同的湿疹患者群体。一组接受这种药物治疗,另一组则只使用安慰剂。试验结束后,比较平均严重程度和平均副作用发生率。然后,该公司还要进行统计检验。如果药物显著地缓解了湿疹症状(以标准差衡量)且没有显著地导致副作用,则可以批准该药物。美国食品药品监督管理局并没有使用严格的双标准差规则。治疗某种致命疾病且同时只会导致轻微副作用的药物比能够缓解真菌导致的灰指甲症状但同时却会导致骨癌发病率高于预期的药物的统计标准更低。美国食品药品监督管理局还关注统计检验的效力,也就是测试能够证明药物有效的概率。
六西格玛方法
这里要讨论的正态分布规律的最后一个应用是六西格玛方法,我们将说明正态分布是如何通过六西格玛方法为质量控制提供有效信息的。六西格玛方法是摩托罗拉公司于20世纪80年代中期提出的,目的是减少误差,该方法根据正态分布对产品属性进行建模。试想这个例子:一家企业专业生产制造门把手所用的螺栓。它生产的螺栓必须天衣无缝地与其他制造商生产的旋钮组装在一起。规格要求是螺栓直径为14毫米,但是任何直径介于13毫米与15毫米之间的螺栓也可以接受。如果螺栓的直径呈正态分布,均值为14毫米,标准差为0.5毫米,那么任何超过两个标准差的螺栓都是不合格的。两个标准差事件发生的概率为5%,这个概率对于一家制造企业来说太高了。
六西格玛方法涉及缩减标准差的大小从而降低生产出不合格产品的可能性。各企业可以通过加强质量控制来降低误差率。2008年2月26日,星巴克超过7 000家门店停止营业3小时,目的是重新培训员工。与此类似,航空公司和医院所用的检查清单也有助于减少变差。 7 六西格玛方法降低了标准差,这样即使出现了6个标准差的误差,也可以避免出现故障。在生产螺栓这个例子中,就要求必须把螺栓直径的标准差减少至1/6毫米。而6个标准差的含义是,误差率仅为十亿分之二。实际使用的阈值假设1.5个标准差的出现是不可避免的。因此,一个六西格玛事件实际上对应于一个四个半西格玛事件,这时允许的误差率大约为三百万分之一。
在六西格玛方法中应用中心极限定理(即隐含的加性误差模型)是如此微妙,因而几乎没有什么人注意到。螺栓制造企业不可能精确地测量每个螺栓的直径,它可能会抽样几百个,并根据这样一个样本来估计均值和标准差。然后通过假设直径的变差源于多种随机效应的总和,例如机器振动、金属质量变化以及压力机温度和速度的波动,就可以利用中心极限定理推断出正态分布。这样一来,这家螺栓制造企业就可以得出一个基准标准差,然后花大力气去降低它。
对数正态分布:乘法冲击
中心极限定理要求我们对随机变量求和或求平均值,以获得正态分布。如果随机变量是不可相加而是以某种方式相互作用的,或者如果它们不是相互独立的,那么产生的分布就不一定是正态分布。事实上,一般情况下都不会是。例如,独立随机变量之间的乘积就不是正态分布,而是对数正态分布。 8 对数正态分布缺乏对称性,因为大于1的数字乘积的增长速度比它们的和的增长速度快,比如,4+4+4+4=16,但4×4×4×4=256;而小于1的数字的乘积则比它们的和小,比如, ,但 。如果将20个不均匀地分布在0到10之间的随机变量相乘,那么多次相乘后所得到的乘积将会包括一些很接近于零的结果与一些相当大的结果,从而生成如图5-2所示的对数正态分布。
图5-2 一个对数正态分布
一个对数正态分布的尾部长度取决于随机变量相乘的方差。如果它们的方差很小,尾巴就会很短,如果方差很大,尾巴就可能会很长。如前所述,将一组很大的数相乘会产生一个非常大的数字。在各种各样的情况下都会出现对数正态分布,包括英国农场的大小,地球上的矿物质的浓度,从受到感染到症状出现的时间,等等。 9 大多数国家的收入分布也近似于对数正态分布,尽管在最顶端,许多点会偏离对数正态分布,因为高收入的人“太多”了。
一个简单的模型可以解释为什么收入分布更接近于对数正态分布而不是正态分布。这个模型将与工资增长有关的政策与这些政策所隐含的分布联系起来。大多数企业和机构都按某种百分比来分配加薪,表现高于平均水平的人能够得到更高百分比的加薪,表现低于平均水平的人则只能得到更低百分比的加薪。与这种加薪方法相反,企业和机构也可以按绝对金额来分配加薪,例如普通员工可以获得1 000美元的加薪,表现更好的人可以获得更多,而表现更差的人则只能获得更少。
百分比加薪方法与绝对金额加薪方法两者之间的区别乍一看似乎只是语义上的区别,但其实不然。 10 如果每一年的绩效都是相互独立且随机的,那么根据员工绩效按百分比加薪,就会产生一个对数正态分布。即使后来的表现相同,未来几年的收入差距也会加剧。假设一名员工因过去几年表现良好,收入水平达到了80 000美元,而另一名员工则只达到了60 000美元。在这种情况下,当这两名员工的表现同样出色并都可以获得5%的加薪时,前者能够获得4 000美元的加薪,后者却只能得到3 000美元的加薪。这就是说,尽管绩效完全相同,不平等也会导致更大的不平等。如果企业按绝对数额分配加薪,那么两名绩效相同的员工将获得相同的加薪,由此产生的收入分布将接近正态分布。
小结
在本章中,我们讨论了正态分布的结构、逻辑和功能。我们看到,正态分布可以用均值和标准差来表示。中心极限定理说明,当我们将有限方差的独立随机变量相加或求平均值时,正态分布是如何产生的。还给出了随机变量的均值与总和的标准差公式,阐述了这些性质会带来的后果。我们现在已经知道,小的群体更有可能呈现异常事件,如果缺乏对这类事件的洞察力,就会做出不正确的推断并采取不明智的行动。我们还了解到,假设随机变量服从正态分布,科学家就可以对统计检验的显著性和效力做出判断。本章还分析了在过程管理中如何利用正态假设来预测失败发生的可能性。
并不是每个量都可以写成独立随机变量的总和或平均值,因此并非所有事件都满足正态分布。有一些量是独立随机变量之间的乘积,因此它们是对数正态分布的。对数正态分布只取正值,有更长的尾巴,意味着更大的事件和更多非常小的事件。当高方差的随机变量相乘时,尾部会变得更长。长尾分布的可预测性较差,而正态分布则意味着很强的规律性。作为一个预测规则,我们当然更倾向于规律性,而不是发生很大事件的可能性。因此,如果了解了生成各种各样分布的逻辑,我们将会获益匪浅。我们可能更希望随机冲击相加,而不是相乘,以减少发生很大事件的可能性。
06 幂律分布
每个基本定律都有例外,但是你仍然需要定律,否则你所拥有的只是毫无意义的观察。那不是科学,只是做笔记。
杰弗里·韦斯特(Geoffrey West)
在本章中,我们将讨论幂律分布。幂律分布就是通常所称的长尾分布或重尾分布。在把这种分布绘制在图上时,会产生对应大事件的沿水平轴运行的长尾。例如城市人口分布、物种灭绝、万维网上的链接数量以及企业规模等,所有这些分布都有很长的尾巴,视频下载量、书籍销量、学术论文引用数量、战争中的伤亡人数、洪水和地震的分布也是如此。换句话说,在这些分布中,都包括了非常大的事件:东京有3 300万居民,J. K.罗琳的“哈利·波特”系列畅销书卖出了5亿本,1927年密西西比河的大洪水将面积相当于西弗吉尼亚州的地区淹在了9米深的水下…… 1
要想对幂律分布与正态分布之间的巨大差异有一个直观的了解,不妨想象一下人类身高的幂律分布。如果人类身高与城市人口的幂律分布类似,而且假设所有美国人的平均身高为175厘米,那么美国人当中将会有一个人比帝国大厦还高,有超过1万人比长颈鹿还高,同时身高小于18厘米的人也将超过1.8亿人。 2
产生幂律分布要求非独立性,通常以正反馈的形式出现。 3 图书销售、森林火灾的发生和城市人口都不同于光顾杂货店的次数,这些并不是独立的。当某个人买了一本《哈利·波特》后,其他人也可能跟着买;当一棵树着火时,火势会蔓延到邻近的树木;当一个城市的人口增加时,这个城市的基础设施会随之改善,工作机会也会随之增加,从而对其他人更具吸引力。社会学家罗伯特·默顿(Robert Merton)把这种已经拥有更多的人未来也能够得到更多的现象称为马太效应(Matthew effect),正如《圣经》中所说:“凡有的,还要加给他,叫他有余;凡没有的,连他所有的,也要夺去。”(马太福音25:29)
既然在各种领域中都能发现发幂律分布,那么如果有某个机制可以解释所有这些幂律分布就太好了,可惜的是,这种机制并不存在。如果幂律分布的每一个实例都有一个独特的解释,那将更好,可惜的是,这也不是真的。相反,我们只拥有一系列能够生成幂律分布的不同模型,每个模型都能解释不同的现象。
在本章中,我们将重点放在两个幂律分布模型上。第一个模型是优先连接模型(preferential attachment model),它能够解释城市规模、图书销量和网络链接等;第二个模型是自组织临界模型(self-organized criticality model),它能够解释交通拥堵、战争伤亡,以及地震、火灾和雪崩的大小等。在第12章中讨论熵时,我们还会研究第三个幂律分布模型,在那个模型中,幂律会在给定均值的条件下最大化不确定性。在第13章中,我们将证明随机游走模型中的返回次数也满足幂律分布。还有其他一些模型则表明幂律会从最优编码、随机停止规则和组合分布中产生。 4 本章还将讨论幂律分布的结构、逻辑和功能。在讨论中,我们重新评估了特别大的事件的影响,并描述在预防和规划这些事件上的能力局限。
幂律分布的结构
在幂律分布中,事件发生的概率与事件大小的某个负指数成比例。例如,我们熟悉的函数 就描述了一种幂律。在这个幂律分布中,一个事件的概率与其大小成反比:事件越大,发生的可能性越小。因此,在幂律分布中,小事件的数量要比大事件要多得多。
幂律分布
一个定义在区间[x min ,∞)上幂律分布 5 可以写成如下形式:
P (x )=Cx -a
其中,指数a >1决定了尾部的长度,同时常数项 确保总概率的分布。
幂律中指数的大小决定了大事件的可能性和大小。当指数等于2时,事件的概率与其大小的平方成比例。大小为100的事件,发生的概率与 (或一万分之一)成比例。当指数增加到3时,该事件的概率与 成比例。对于2或更小的指数,幂律分布缺乏一个可明确定义的均值。例如,从指数为1.5的幂律分布中抽取出来的数据均值永远不会收敛。换句话说,它会无限地增加。
图6-1显示了网页链接数量分布的近似图。
图6-1 网页链接的近似幂律分布
大事件的可能性将幂律分布与正态分布区分开来,因为在正态分布中,我们实际上从未见过大事件,而在幂律分布中,大事件虽然也很少见,但是它们发生的频率足以引起注意和准备。即使是百万分之一的事件也必须加以考虑。例如,地震大小的分布接近于指数大约为2的幂律。如果发生了震级大于里氏9.0级的地震,不但建筑物会被夷为平地,整个地形地貌都会变得面目全非。这是一个发生的可能性只有百万分之一的大事件,在一个世纪的时间中,这种规模的地震发生的概率为3.5%。 6
为了更清楚地分析概率为百万分之一的大事件在正态分布与长尾分布之间的差异,现在来看一看由于恐怖袭击所造成的死亡人数的分布,它遵循幂律分布,且指数为2。 7 在长尾分布中,概率为百万分之一的恐怖袭击事件是一个差不多有800人死亡的事件。如果由于恐怖袭击造成的死亡人数满足一个均值为20、标准差为5的正态分布,那么概率为百万分之一的事件将只会导致不到50人死亡。
幂律分布有明确的定义,不是每一个长尾分布都是幂律分布。要想快速地检验某个分布是不是幂律分布,可以用双对数坐标系把该分布画出来:双对数坐标系可以将事件大小及其概率转换为相应的对数值,并将幂律分布转换为直线(图6-2)。 8
图6-2 双对数坐标中的幂律分布(黑色)与对数正态分布(灰色)
换句话说,在双对数坐标系中,自始至终都呈直线的图形就是幂律分布的证据,而一开始是直线然后逐渐下降的图形则与对数正态分布(或指数分布)相对应。对数正态分布图形向下弯曲的速率取决于产生分布的变量的变化。 9 当我们增大对数正态分布的方差时,对数正态分布的尾部增大,从而使在双对数坐标系中的图形更接近线性。 10
齐普夫分布(Zipf distribution)是幂律分布的一个特例,即指数等于2的幂律分布。指数等于2的幂律分布的一个重要特征是,事件的等级排列序号乘以其概率等于常数,这个规律被称为齐普夫定律(Zipf's Law)。单词符合齐普夫定律,最常见的英语单词the出现的频率为7%,第二最常见的英语单词of出现的频率为3.5%。请注意,of的等级排列序号2乘以频率3.5%,恰恰等于7%。 11
齐普夫定律
对于指数为2的幂律分布(a =2),事件的等级排列序号乘以它的大小等于常数,即:
事件等级×事件大小=常数
包括美国在内的许多国家的城市人口分布大体上符合齐普夫定律。从美国2016年的城市人口数据可以看出,每个城市的人口排名乘以它的人口总数的值接近800万(表6-1)。
表6-1 城市人口分布
幂律分布的逻辑
现在,我们着手讨论若干产生幂律分布的模型。如果没有适当的模型,幂律分布就只是一种无法解释的模式。
我们要讨论的第一个模型是优先连接模型。模型假设实体以相对于其比例的速度增长。优先连接模型刻画了罗伯特·默顿所说的马太效应:更多导致更多。这个模型考虑了通过新移民到来而实现增长的人口。新到达的人,要么加入现有的某个实体,要么自己创建新的实体。如果是前者,那么加入现有某个实体的概率与该实体的大小成正比。
优先连接模型
一连串物体(人)一个接一个地到达。第一个到达者创建一个实体。后续每次有人到达时都应用以下规则:在概率p (较小)的情况下,新到达者创造一个新的实体;在概率(1-p )的情况下,新到达者加入现有的某个实体。加入某个特定实体的概率等于该实体的大小除以到目前为止所有到达者的数量。
不妨想象一下大学新生进入大学校园时的情景。第一个来到学校的学生创建了一个新的社团,第二个到达的学生以较小的概率创建了自己的社团,更有可能的是,他会加入第一个学生创建的社团。前10个到达的学生可能会创建3个社团:一个有7个成员,一个有两个成员,一个有一个成员。第11个到达的学生只会以极小的概率创建第4个社团,如果不创建新的社团,她就加入现有的社团。如果这样做,那么她有70%的可能性加入已有7个学生的社团,有20%的可能性加入已有两个学生的社团,只有10%的可能性加入只有一个学生的社团。
优先连接模型有助于解释为什么网络链接、城市规模、企业规模、图书销量和学术引用数量的分布都是幂律分布。在这些情况下,一个行动(比如一个人购买了一本书)会增加其他人也这样做的可能性。如果从某家企业购买商品的概率与它在当前市场的份额成正比,同时如果新企业进入市场的概率较低,那么优先连接模型预测企业规模的分布将是幂律分布。同样的逻辑也适用于图书销量、音乐下载量和城市发展。
我们要讨论的第二个模型是自组织临界模型,它通过在系统中建立相互依赖关系的过程产生幂律分布,直到系统达到临界状态为止。自组织临界模型有很多种。其中,沙堆模型(sand pile model)假设有人将沙粒从距桌面几十厘米的地方洒落到桌子上。随着沙粒不断增多,一个沙堆开始形成。最终,沙子的堆积会达到临界状态,此后每加一次沙子都可能导致“沙崩”。在这种临界状态下,多加入的沙子通常要么没有影响,要么最多只会导致一些沙子下滑。这些属于幂律分布中的数量众多的小事件。但有时,只要再加入一粒沙子就会导致大规模的“沙崩”,这就是大事件。
森林火灾模型(forest fire model)也是自组织临界模型的一种。假设树木可以在一个二维网格上生长,这些树木也可能会随机地被闪电击中。当树木的密度较低时,由闪电引发的任何火灾的规模都很小,最多只会蔓延到几个格点。当树木密度变得足够高时,再被闪电击中就会导致森林大火。
森林火灾模型
“森林”最初只是一个空的N ×N 网格。每个周期在网格上随机选择一个格点。如果该格点为空,那么就以概率g 在那里种上一棵树。如果该格点上已经有树,那么闪电会以概率(1-g )击中该格点。如果该格点有一棵树,那么树会着火,火势会蔓延到所有连接到该格点的有树的格点。
这里需要注意的是,在森林火灾模型中,被闪电击中的概率等于1减去种树的概率。这种结构使我们能够改变种树与闪电击中树的相对速度。这是一种简化,减少了模型中参数的数量。在对各种各样的种树速度进行试验之后,我们发现,当种树的速度接近1时,树木的密度会增加到一个临界状态:在这个相对茂密的森林中,被闪电击中有可能摧毁很大一片森林。在这种临界状态下,森林中斑块大小的分布,以及火灾大小的分布,都满足幂律分布。此外,森林还会自然而然地趋向这种密度水平。如果密度较低,密度会增加(因为火灾很小)。如果密度超过了阈值,那么任何火灾都会毁掉整个森林。因此,树木密度自组织地达到了一个临界状态。 12
在沙堆模型和森林火灾模型中,宏观层面的变量,也就是沙堆的高度或森林的密度,都具有一个临界值。当有像沙崩或火灾这样的大事件发生时,宏观层面的变量值会减小。这两个模型的一些变体可以解释太阳耀斑、地震和交通拥堵的分布。不过,当事件发生时,不断增加的宏观层面的变量会减少,这虽然是必要的,但对于自组织临界性来说是不够的。均衡系统也具有这种特征。水通过溪流,流入和流出湖泊,但是由于水流很平稳,所以湖水的水位是逐渐变化的。通过自组织达到临界状态的关键假设是压力平稳地增加(就像水流入湖中一样),同时压力在爆发时迅速减少,这包括可能发生的大事件。
长尾分布的含义
在这里,我们讨论长尾分布的三个含义,即它们对公平、灾难和波动性的影响。根据定义,与正态分布相比,长尾分布意味着少数几个大“赢家”(大崩溃、大地震、大火灾和严重的交通拥堵)和很多的“输家”;而正态分布则是关于均值对称的。长尾分布也可能增加波动性,因为更大实体中的随机波动会产生更大的影响。
公平
如果某一个人写的书更好、创作的歌曲更有吸引力、发表的论文学术水平更高,那么他应该比其他人获得更大的名声和更多的金钱。但是,如果另一个人只是因为表现得稍微好一点,或者完全靠碰巧走运就比其他人赚到了多得多的钱、获得了大得多的名声,那就有失公平了。就像我们在优先连接模型中看到的,因为马太效应,正反馈创造了少数大赢家。在市场中,要发生正反馈,人们必须知道别人买了什么商品,而且人们必须有能力购买商品。就手机上的应用程序而言,根本不存在可能会减慢正反馈的生产限制,但是卡车就会面临这种约束。福特公司不可能无限增加F-150卡车的产量,但是财捷集团(Intuit)却可以无限量地销售TurboTax应用程序,只要有人愿意下载。
实证研究表明,社会效应会创造更大的赢家。在音乐实验室的实验研究中,研究者让大学生挑选和下载歌曲。在第一个实验组中,被试不知道其他人下载了哪些歌曲,下载量的分布具有较短的尾部,没有出现下载量超过200次的歌曲,且下载量少于30次的歌曲也只有一首。在第二个实验组中,被试知道其他人下载了哪些歌曲,下载量的分布具有较长的尾巴,有一首歌的下载量超过300次。而且,超过一半歌曲的下载量都不到30次。
尾巴变长了,社会影响增加了不平等。如果社会影响只会导致人们下载更好的歌曲,那么这种不平等也不会造成什么问题。但事实上,这两个实验组的下载量之间的相关性并不强。我们可以将第一个实验组中每一首歌的下载次数解释为歌曲质量的一个表征,那么这项研究表明,社会影响并没有导致人们去下载更好的歌曲。大赢家的出现不是随机的,但它们其实并不一定是最好的。 13
当然,我们必须非常小心:不能从一项研究中就得出太强的推论。然而,我们确实可以推断,卖出了5 000万册书的畅销书作家、学术论文得到了20万次引用的科学家当然是值得赞许的,但是这种极端的成功本身就表明中心极限定理是不成立的。人们不会独立地购买书籍或引用论文。惊人的成功可能意味着正反馈,也许还有一点运气。在本书的最后一章讨论收入不平等的原因时,我们还会回到这些思想上来。 14
灾难
长尾分布还包括灾难性事件:地震、火灾、金融崩溃和交通拥堵。尽管模型无法预测地震,但确实可以深入解释为什么地震的分布会满足幂律。这些相关的知识告诉我们各种强度的地震发生的可能性。我们至少知道会发生什么,尽管不知道什么时候会发生。 15
而且,森林火灾模型已经可以指导行动了。人们可以通过选择性地在森林中采伐一些树木来降低树木的密度,以防止大火灾的发生,也可以制造防火带。有人会说,在模型告诉我们应该这样做之前,我们早就懂得采伐树木或建造防火带了。这当然是事实,但重要的是,森林火灾模型能够让我们意识到临界密度的存在。临界密度可能因森林而异,可能取决于树木的类型、盛行风速和地形。这个模型有效地解释了为什么森林会出现自组织临界状态。
我们还可以使用这个模型来做一个很好的类比。请回想一下,第1章中讨论了席卷整个体系的金融机构的破产,我们可以将森林火灾模型应用到那种情况下:把银行和其他金融机构想象为网格上的树,网格上的邻接则表示存在未偿还的贷款。一个银行破产相当于一棵树着火,而火势有可能会蔓延到邻近的银行。
当银行的“密度”变得越来越高的时候,这种看似浅显的森林火灾模型就预示着大规模的银行破产随时可能发生。不过,在深入探析这个类比时,我们可以发现它存在四个方面的缺点。第一,金融机构的网络并未嵌入物理空间,各家银行的连接数也不相同,有的银行可能拥有几十项金融债务,而有些银行则可能只有一两项金融债务。第二,森林中的树木不能主动采取行动来减少火势蔓延的可能性,但是银行却可以,它们可以提高自己的储备水平。
第三,一家银行拥有的连接越多,其破产会产生连锁反应的可能性就越低,因为它的损失已经分散到了更多的银行身上。例如,如果一家银行只从另一家银行借款,那么如果它在借来的1亿美元的贷款上出现了违约,第二家银行可能会破产。但是,如果第一家银行是从其他25家银行分别借款的,那么任何一家银行都不至于受到重创。在这种情况下,银行体系可以很好地消化这个违约事件而不会崩溃。 16
第四,从一家银行的破产到另一家银行的破产,这种蔓延会不会出现还取决于银行的投资组合。如果两家“相连”的银行拥有相似的投资组合,那么当一家银行破产时,另一家银行也可能早就脆弱不堪了,这时银行破产蔓延的可能性就很大。如果整个网络中的所有银行都拥有相同的投资组合,那么最糟糕的情况就很可能会出现。在这种情况下,当一家银行破产时,就可能会出现普遍的银行破产。 17 但是,如果每家银行分别持有不同的投资组合,那么一家银行表现不佳并不意味着其他银行也表现不佳。在这种情况下,银行破产就可能不会蔓延。因此,一个模型要想真正有用,就必须考虑到各种不同的投资组合。如果没有这些信息,那么即便知道哪些银行对其他银行负有未偿还债务也不足以预测或防止银行破产,而且银行之间的高互连性的净效应也是不明确的。
波动性
最后,我们讨论最微妙的一个含义。如果组成幂律分布的实体规模出现了波动,那么幂律的指数就可以作为衡量系统层面波动性的一个代表。由此可以推断,企业规模的分布应该会影响市场波动性。例如,我们可以将某个国家的国内生产总值视为数千家企业的总产量。如果各家企业的生产水平相互独立且变差有限,那么根据中心极限定理,这个国家的国内生产总值分布将服从正态分布。也就是说,企业生产水平的差异越大,总体波动性就越大。如果企业规模的长尾分布导致生产水平上更大的变差,那么这种长尾分布也必定与更大的总体波动性相关。
对美国波动性模式的实证研究表明,波动性在20世纪70年代和80年代有所上升,然后在接下来的20年间又下降了,有人将后面这20年称为“大稳健”(Great Moderation)。 18 但是,从2000年前后开始,波动性再次上升。研究显示,可以通过企业规模分布的变化来解释这种波动性演变的模式。 19 随着企业规模分布的尾部变得越来越长(越来越短),最大的企业对波动性的影响越来越大(越来越小)。换句话说,总体波动性会随企业规模分布的尾部变长(变短)而增加(减少)。1995年,当总体波动性较低时,沃尔玛的营业收入为900亿美元,相当于美国国内生产总值的1.2%。到了2016年,沃尔玛的营业收入增加到了4 800亿美元,占国内生产总值中的百分比提高到了2.6%,沃尔玛在美国国内生产总值中所占的份额增加了一倍多。2016年,沃尔玛收入的增加或减少可能导致的总体波动性因而也增加了一倍多。
没有人能够反驳这个观点的逻辑。因此,相关的问题是,一个经过校准的模型到底能不能生成与实际波动水平相对应的效应。校准拟合结果表明,确实非常接近。企业规模的分布很好地对应于大稳健时期的历史证据。虽然这种相关性并不能证明是企业规模分布的变化(而不是政府对经济的有效管理或更好的库存控制)导致了这种变化,但是它确实足以“阻止”我们拒绝这个模型。 20 这些证据还为我们在未来评估各种波动时将这种模型加入我们的工具箱提供了很好的理由。
设想长尾分布的世界
在长尾分布中,大事件发生的概率必须加以考虑。在本书讨论的多个模型中,长尾分布是由于反馈和相互依赖性而产生的。我们应该高度注意这个结果。随着世界中相互联系性的提高和反馈的增加,我们应该会观察到更多的长尾分布,同时现在关注的这些长尾分布的尾部也可能会进一步拉长。这就是说,不平等可能会增加,灾难可能变得更大,波动性也会变得更加剧烈。这些都是不可取的。
到目前为止,我们都是在宏观层面上讨论这些事件的可能性的。它们也同样可能发生在更小的尺度上。波士顿的中央隧道工程(Big Dig)是一条穿过市中心的长达5 000多米的隧道,它是一个中等规模的灾难的典型例子。这个项目花费了140亿美元(相当于最初预算的3倍多),并成了美国有史以来最昂贵的公路项目。根据模型思维的方法,我们不会把这个项目简单地视为一个单独的项目,而是作为很多子项目的总和:挖掘深沟、浇筑混凝土隧道、设计排水系统、建造墙壁和“顶盖”。项目的总成本等于各个子项目成本的总和。
如果每个子项目的成本都是相加的,那么这个项目的成本分布将是正态分布。 21 然而,各个子项目的成本是相互关联的。原本计划用来将顶盖黏合到位的那种环氧树脂强度不够时,就不得不用成本更高、强度更大的另一种环氧树脂来代替,从而增加了项目的成本。而且,第一种环氧树脂的失效还产生了移除和更换折叠顶盖的额外成本。这些工作反过来又需要重做项目的其他几个部分。于是总体成本增加了一倍以上,因为每个项目必须撤销然后重做。这种相互依赖性最终导致了一个大型且昂贵的事件。
大事件发生的可能性使计划变得非常困难。像地震这样自然灾害的分布符合幂律分布。因此,大多数事件都是很小的事件,但是有些事件一旦发生就会很大。如果灾难性事件遵循指数为2的幂律分布,那么政府就必须时刻保留大量的储备金或者至少做好应对的准备,必须未雨绸缪。如果政府为了这个目的而在应急基金账户中保持了巨额盈余,那么如果没有大事件发生,政府可能会阻止自己花掉这笔钱或减税。
搜索与机会
我们可以在某些搜索模型中应用关于分布的知识来解释为什么一个人获得机会的数量可能与他的成功经历密切相关。在这里,事实上是将一类模型(分布模型)嵌入了另一类模型(搜索模型)。我们在搜索的时候,无论是搜索新鞋、工作职位还是度假胜地,其实是不知道所选择的价值的,直到去真的尝试它。不过,我们可能会对所选择的价值的分布有所了解,例如它的均值、标准差,以及这种分布是正态分布还是长尾分布等。