饭饭TXT > 学习管理 > 《一眼识破真相的思考力(出版书)》作者:[美]丹尼尔·列维汀/译者:张建军【完结】 > 一眼识破真相的思考力.txt

第2章

作者:美-丹尼尔·列维汀/译者:张建军 当前章节:10276 字 更新时间:2026-6-22 11:32

平均数的妙用

平均数是一种非常有用的概括统计量,甚至比饼状图还易于理解。有了平均数,我们就可以用单一数字来描述大量的信息。比如,我们可能需要知道一间屋子里的全体人员所拥有的平均财富,以便让资金募集者或销售经理确定是否有必要与他们会面。又比如,我们也许需要了解汽油的平均价格,才能估算从温哥华驾车到班夫的交通成本。然而,平均数有时也具有一定的迷惑性和复杂性。

计算平均数的方法有三种,其计算结果往往各不相同。因此,具备统计学敏锐感的人们通常都会避免笼统地使用“平均数”一词,而代之以算术平均数、中位数和众数这些更为准确的术语。我们不说“中间平均数”“居中平均数”,或干脆简称为“平均数”,我们一般称其为算术平均数、中位数和众数。有时候,这三种平均数的数值相等,但多数情况下却并不相同。如果你只看到“平均数”一词,一般情况下它指的是算术平均数,但你也不能就此肯定。

上述三种平均数中,算术平均数最常见。把全部观测或报告数值相加,再除以相应数字的个数,即可得到算术平均数。例如,对于身处同一间屋子里的所有人来说,他们拥有财富的平均数就等于总财富除以总人数。假如屋子里有10个人,每个人有10万美元,那么总财富就是100万美元。无须使用计算器,你就能计算出所有人的财富算术平均数为10万美元。再假如,另一间屋子里同样有10个人,每个人有5万~15万美元,但总财富也是100万美元,那么此房间里所有人的财富算术平均数仍然为10万美元(原因在于,我们采用的计算方法都是用总财富100万美元除以总人数10,而不考虑具体每个人的财富)。

中位数指的是位于一组数字(统计学家称其为一个分布)中间的那个数字:整组数字中有一半数字大于该数字,而另一半数字则比它小。上文提到,平均数可以用单一数字来描述大量的信息。在你的统计观测值中,当一些观测值与绝大多数观测值之间存在巨大差异时,中位数就可以很好地起到这种作用。统计学家称其为极端值。

如果我们拜访的屋子里面有9个人,假设其中8个人都有10万美元左右,而且只有1人由于负债而濒临破产,此人有50万美元的债务,那么,这个屋子里9个人的财富情况为:

第一个人:–500000美元

第二个人:96000美元

第三个人:97000美元

第四个人:99000美元

第五个人:100000美元

第六个人:101000美元

第七个人:101000美元

第八个人:101000美元

第九个人:104000美元

现在,我们把上述数字相加,所得结果为299000美元;再除以统计观测值的总个数9,得到的算术平均数为33222美元。但是算术平均数似乎并没有起到描述屋子里9个人的财富特征的作用。从所得的算术平均数来看,你的资金募集者或许会认为已经没有必要与这些人会面。把财富平均数拉低的其实只有1人,即有1个极端值。这就是算术平均数本身存在的问题:它对极端值敏感。

上述一组数字的中位数应为100000美元:有4人的净财富值小于它,另外4人的净财富值则大于它。该组数字的众数为101000美元,它在整组数字中出现的次数最多。在这个特殊的例子当中,中位数和众数的作用要比算术平均数更大。

利用各种平均数来操控数据,从而实现个人的某种目的,其方法有很多种。

现在我们假设:你和两位朋友一起创办了一家公司,有5名员工。时值岁末,你准备向全体员工通报公司的财务状况。因为这样做,一则能使废寝忘食、辛劳一年的员工感到欣慰;二则还可以为公司吸引投资方。假设4名员工(均为程序员),每人的年薪为70000美元,另外1名员工(接待人员/办公室经理)的年薪为50000美元。那么,公司所有员工全年工资的算术平均数为66000美元[(4×70000+1×50000)/5]。你和其他两名合伙人,每人的年薪按照100000美元计算。据此,可计算出公司的年度工资成本为:4×70000+1×50000+3×100000=630000美元。再假设公司该年度的利润为210000美元,你把这部分钱作为奖金与其他合伙人平均分配。那么,公司三位创始人每人每年可得到170000美元(100000+70000)。如何针对这些情况写年度财务报告呢?

你可以这样汇报:

员工平均薪水:66000美元

公司创始人平均薪水+平均所得奖金:170000美元

虽然这样的财务报告很真实,但极有可能除了你和你的母亲之外,其他人都不会感到满意。如果员工风闻此事,他们可能会觉得公司亏欠自己,而潜在的投资方则会认为公司创始人得到的回报过多。因此,你还可以这样汇报:

员工平均薪水:66000美元

公司创始人平均薪水:100000美元

利润:210000美元

这样的报告会让潜在的投资方更满意。对于你已经把利润在创始人之间进行分配一事,大可略去不提。在向员工做通报时,你也可以省略最后一项有关公司利润的内容。4名程序员都会觉得公司看重他们的价值,因为他们的年薪高于员工平均薪水水平。那位负责接待事宜的办公室经理则不会心满意足,毫无疑问,她知道程序员的薪水肯定比自己高。

现在我们再假设:你认为公司人手紧缺,想要招聘新员工。你想就此说服那两位对批判性思考知之甚少的合伙人。就像很多公司的做法一样,你可以把210000美元的利润在5名员工之间进行分配,从而做出关于“员工人均年度创造的利润”的年度财务报告:

员工平均薪水:66000美元

公司创始人平均薪水:100000美元

员工人均年度创造的利润:42000美元

此时,你便可以宣称,公司支付给员工薪水的64%(42000/66000)最终都会以利润的形式收回。这意味着,在收回全部年度利润后,公司真正用于支付员工薪水的部分只有全部员工年度总工资的36%。当然,这些数字并不能说明增加员工人数可以提高公司的利润额。公司的利润额也有可能与员工人数毫不相干。但是,对于不会进行批判性思考的人来说,这个年度财务报告足以作为你提议增加员工人数的理由。

我们再来看一种假设情形。假如你想要宣称:作为一名管理者,你对待员工非常公平、公正,并且实际上创始人获得的利润和员工的薪水非常合情合理。那么,怎样做年度财务报告呢?你可以拿出210000美元的利润,将其中的150000美元作为自己和其他合伙人的工资或奖金,而把剩余的60000美元报告为“利润”。这一次,在计算公司平均薪水时,要把你和另外两位合伙人的工资和奖金包括在内。

公司平均薪水:97500美元

公司创始人平均利润:20000美元

下面的报告则更有趣:

工资总成本+奖金:840000美元

总薪水:780000美元

公司利润:60000美元

这个报告看上去就非常合理了,是吧?整家公司可用于支付员工薪水的资金加上利润总共为840000美元,其中公司所有者拿走的经营利润只有60000美元(7%)。你的员工肯定认为你无可指责——谁会对只拿走利润7%的创始人心存怨言呢?其实,一个创始人拿走的利润远没有这么多——7%的利润还要在三名公司创始人之间平均分配,每人只能得到2.3%的利润。这根本不值得抱怨!

你的年度财务报告甚至可以做得更出色。假如在开始经营的第一年,公司只有兼职员工,他们每年可为公司创造40000美元的利润。第二年,公司只有全职员工,所创造的利润为上面提到的66000美元。此时,你就可以如实宣告:公司员工创造的年度平均利润上涨了65%。这显示出你是多么出色的一位管理者!不过,此处,你在报告中掩盖了对比兼职员工和全职员工的事实。这种做法并非你的首创:早在20世纪40年代,美国钢铁公司就使用过这种方法。

在刑事审判中,信息的呈现方式——统计所取的抽样单位——深刻地影响着陪审员对嫌疑人有罪与否的最终判决。请看这样两条证词:(1)“如果从犯罪现场采集的血滴不是来自犯罪嫌疑人,那么后者的血型与其相匹配的可能性只有0.1%”(千分之一);(2)“休斯敦市有千分之一的人血型与犯罪现场的血滴相匹配”。尽管这两条证词在数学意义上完全等价,但比较一下,第一条证词远比第二条证词更有说服力。 [1]

平均数常用于表达诸如“每X个婚姻中就有1个以离婚收场”之类的统计结果,但这并不意味着这样的统计结果就一定适用于你所在的街区、桥牌俱乐部或你认识的人。它可能适用,也可能不适用——因为它表达的只是全国范围内的一种平均情况,还可能存在某些干扰因素,它们在预测谁将会离婚、谁不会离婚中也起着一定作用。

与此类似,也许你曾读到过这样的报道:每5个新生儿当中就有1个是中国婴儿。你注意到,街上的那个瑞典家庭已经有了4个孩子,而且现在母亲腹中正怀着1个孩子。不过,这并不意味着这位瑞典母亲即将生出一个中国婴儿——“每5个新生儿当中就有1个是中国婴儿”的说法指的是全世界范围内新生儿的一种平均情况,并非限定于某个特定家庭或街区,甚至特定国家的出生情况。

对于各种平均数及其使用方法,我们一定要多加小心。它们在迷惑我们时所采用的一种方法是:把从完全不同的总体中抽取的样本综合在一起。采用这种方法,就会得出类似下面这样荒谬的论述:

平均来说,人类的睾丸数量为1个。 [2]

这个例子说明了算术平均数、中位数和众数之间的差别。由于世界上女人的总人数略多于男人的总人数,所以中位数和众数均为0,而算术平均数接近于1(为0.98左右)。

另外,还有一点也需要小心对待并铭记于心:平均数并不能说明整组数字的范围。加利福尼亚州死亡谷年平均气温为77华氏度(25摄氏度),令人感觉非常舒适。但是,该地区气温的变化范围却可能要了人命。因为有记录显示,死亡谷的气温范围在15华氏度(–9.44摄氏度)至134华氏度(56.67摄氏度)。 [3]

再举一例:在一间有100个人的屋子里,所有人的财富平均数非常巨大,达到3.5亿美元。你很有可能认为,这里就是你要派100名最优秀的销售人员去的地方。但是,这间屋子里的100个人可能是由马克·扎克伯格(Mark Zuckerberg,拥有350亿美元净资产)和99名穷人组成。平均数往往会抹去一些重要的差异。

在面对平均数时,我们还要对双峰分布保持警惕。我们知道,众数是一个数组中出现频率最高的数字。在生物学、物理学和社会学的很多数据集当中,数字的分布往往会呈现两个或多个峰——也就是,两个或多个数字出现的频率高于其他数字。

例如,类似上面的图,它表示的可能是一周内的午餐费用支出(x轴)和用餐人数(y轴)。 [4] 假设在你的统计调查中存在不同的两组人:儿童(左峰——他们在学校购买午餐)和企业主管(右峰——他们在豪华餐厅就餐)。这里的算术平均数和中位数可能恰好是位于两个峰值之间的某个数字,所以它们说明不了多少实质问题。事实上,在很多情况下,没有人的午餐费用数字会是算术平均数和中位数所代表的数字。这样的图往往表明,你的样本存在异质性,或者说你所比较的是两种没有可比性的事物。此处,在报告中指出这属于双峰式分布,并且分别给出两个众数,这才是更妥当的做法。把上述不同的两组人分开,并分别统计,才是最佳的处理方式。

不过,当根据平均数得出个人和群组的统计学结论时,一定要提高警惕。鉴于在这方面常常会犯相同的错误,人们对这些错误进行了命名:生态学谬误和例外谬误。当我们依据综合数据(如群组的算术平均数)推断个体情况时,便会出现生态学谬误;而当我们根据少数例外的个体数据推断整个群组的情况时,则会出现例外谬误。

例如,我们假设有两个小城镇A和B,每个城镇的居民人口均为100人。城镇A中有99人每人每年可赚到80000美元,剩下的1人是在自家土地上从事石油钻探的一名超级女富豪,她每年的收入高达5000000美元。城镇B中有50人每人每年可赚到100000美元,另外50人每人每年的收入为140000美元。城镇A居民年收入的算术平均数为129200美元,城镇B居民年收入的算术平均数为120000美元。尽管城镇A居民年收入的算术平均数较高,但如果分别从两个城镇中随机选择一人来比较其年收入,那么来自城镇B的人收入高于城镇A的人的概率为99%。从算术平均数较高的群组中随机选择某人,其年收入很可能也较高,这种看法就属于生态学谬误。

再比如,有种观点认为,富裕的选民更有可能把选票投给共和党,但证据表明较富裕的州往往倾向于投票支持民主党。在这些较富裕的州里,人口数量百分比较小的超级富豪可能使得整个州的财富数字发生了偏离。2004年美国总统大选期间,共和党候选人乔治·W. 布什在较贫穷的15个州获胜,而在较富裕的11个州中,有9个州选择了支持民主党候选人约翰·克里。 [5] 然而,62%的年收入超过200000美元的选民选择投票给布什,而只有36%的年收入不超过150000美元的选民把选票投给了布什。

下面我们举一个例外谬误方面的例子。你可能了解到,沃尔沃汽车属于性能最可靠的汽车品牌之一。所以,你下定决心购买一辆沃尔沃汽车。你去该品牌4S店的途中,恰好从一个沃尔沃修理厂旁边经过。此时,你发现停车场上停满了待修理的沃尔沃汽车。如果你据此改变购买沃尔沃汽车的决定,那么你的所作所为就是在使用数量相对较小的例外情况来推断群组的整体情况。从没有人说过沃尔沃汽车不需要修理,只不过整体而言,这个品牌的汽车出现故障的可能性较小而已(沃尔沃公司有一条提示性的广告语——“具体情况可能会有不同”。这条广告语之所以随处可见,原因即在于此)。同时也要注意,例外谬误在此处还以这样一种方式使你受到了过多的影响:沃尔沃汽车只能在沃尔沃专属修理厂修理。由于你的“基准率”已经发生了转移,所以不会将其视为随机样本。

既然此时你也算是平均数方面的专家了,那么下面这个非常著名的错误认识不应该出现在你身上,即认为生活在100年前的人的寿命不如现代社会的人的寿命长。或许你已经了解到,现代社会人们的预期寿命一直在平稳地提高。对于出生在1850年的人来说,男女的预期寿命分别为38岁和40岁;而对于出生在1990年的人来说,男女的预期寿命分别为72岁和79岁。 [6] 所以有一种观点据此认为,与20世纪相比,19世纪时五六十岁的人并不多见,其原因就在于生活在19世纪的人的预期寿命更短。但实际上,19世纪的人确实活到了同样的岁数——只不过当时婴儿和儿童的死亡率很高,因此拉低了人们的整体预期寿命。在那个时代,如果一个人活过了20岁,那么他的寿命也可能很长。的确,在1850年,一位50岁的白人妇女有望活到73.5岁,60岁的白人妇女则可能活到77岁。现代社会五六十岁的人的预期寿命确实提高了,与1850年相比,预期寿命提高了10年左右。这主要应归功于更好的医疗卫生条件。在上文中,我们曾列举了整间屋子都是收入差别很大的人的一个例子。与该例相同,过去的175年里人们出生时平均预期寿命的各种平均数的变化,反映了两个统计样本之间存在的巨大差异:相对而言,19世纪时的婴儿死亡率更高,所以拉低了人们的预期寿命。

请看一个脑筋急转弯:为什么一个家庭拥有的孩子的平均数量并不等于家庭总数的平均数? [7] 因为统计基准发生了转移[我在此处使用了“平均”一词而未使用“算术平均数”,完全是出于对詹姆斯·詹金斯(James Jenkins)和特雷尔·图滕(Terrell Tuten)二人的尊重,他们共同写了一篇探讨同一主题的论文,并且论文的标题使用的就是“平均”一词]。

现在,我们假设你读到了这样一条信息:在一个位于市郊的社区里,每个家庭平均有3个孩子。那么,你也许会得出结论说,每个孩子平均都有两个兄弟姐妹。但是,这种结论并不正确。当我们提出下述问题时,也会犯与此相同的逻辑错误:每位大学生上的是不是规模平均的大学;每位员工挣的是不是平均工资;或者每棵树木是否平均取自每片森林。

上面所举的所有例子都与统计的基准或我们所研究的样本群组的转移有关。当计算每个家庭的平均孩子数量时,我们的统计样本以家庭为单位。成员很多的家庭和成员很少的家庭当然各自只能算作一个家庭。而当我们计算孩子拥有的兄弟姐妹的平均数(算术平均数)时,我们的统计样本则以孩子为单位。在成员数量很多的家庭里,每个孩子都要计算一次,所以每个家庭中孩子拥有的兄弟姐妹的数量对于孩子兄弟姐妹的平均数来说,显得非常重要。简而言之,一个有10个孩子的家庭,在关于家庭平均孩子数量的统计中只计算一次,但在孩子的平均兄弟姐妹数量统计中则要计算10次。

假设在这个假想的社区里,有一条街道上居住着30个家庭。其中,4个家庭没有孩子,6个家庭各有1个孩子,9个家庭各有2个孩子,11个家庭各有6个孩子。那么,每个家庭平均拥有3个孩子,因为90(孩子总数)除以30(家庭总数)即为3。

我们再来看每个孩子拥有的兄弟姐妹的平均数情况。 [8] 人们所犯的错误在于,他们认为假如每个家庭平均拥有3个孩子,那么每个孩子必定平均拥有两个兄弟姐妹。但是,在上述拥有1个孩子的家庭当中,6个孩子都没有兄弟姐妹。在拥有两个孩子的家庭当中,18个孩子平均都有1个兄弟姐妹。在拥有6个孩子的家庭当中,66个孩子平均都有5个兄弟姐妹。对于全部90个孩子来说,他们的兄弟姐妹总数为348个。因此,尽管平均来说,每个孩子都来自平均拥有3个孩子的家庭,但是却有348个兄弟姐妹可以在全部90个孩子中间进行平均分配,或者说,每个孩子平均拥有的兄弟姐妹数量约为4个。

注:平均每个家庭的孩子数量:3.0。

平均每个孩子的兄弟姐妹数量:3.9。

现在,我们再来思考有关大学规模的问题。美国有很多规模较大的大学(比如俄亥俄州立大学和亚利桑那州立大学),这些大学的在校学生人数均超过了50000人。在校学生人数在3000人以下的规模较小的大学(比如肯扬学院和威廉姆斯学院)也为数众多。如果以学院为统计单位,我们会发现,平均规模学院的在校学生人数为10000人。而如果以学生为统计单位,我们将会看到,平均来说,每位学生所上的大学都是在校学生人数超过30000人的大学。之所以出现这样的结果,其原因在于,当统计学生时,我们从规模较大的学校那里得到了多得多的数据量。类似地,人们并不都分散着住在城市里,平均水平的高尔夫玩家打的也不是平均的回合(总击球数为18洞)。

以上这些例子都涉及了统计基准或分母的转移。在上文中讨论儿童的死亡率时,我们就曾触及了偏态分布。我们再看一个这方面的例子:平均来说,每个投资人赚取不到平均回报。 [9] 在一项研究中,投资100美元,投资期为30年,最终的回报为760美元,或者说每年的回报率为7%。但实际情况表明,不但有9%的投资人的投资受损,而且高达69%的投资人最终都没能得到平均回报额。这是因为,投资所得超过平均投资回报额的少数投资人使得平均回报发生了偏离。在下面这张图中,那些幸运的投资人大赚了一笔,他们把算术平均数拉向了右边。

一项投资额为100美元、投资期为30年的投资回报结果。请注意,大多数投资人的回报小于投资回报的算术平均数,而少数一些幸运的投资人所得到的投资回报超过了投资回报算术平均数的5倍。

[1] Koehler, J. J. (2001). The psychology of numbers in the courtroom: how to make DNA match statistics seem impressive or insufficient. South California Law Review , 74 , 1275. and Koehler, J. J. (2001). When are people persuaded by DNA match statistics? Law and Human Behavior , 25 (5), 493–513.

[2] Attributed to mathematics professor Desmond MacHale of University College, Cork, Ireland.

[3] http://en.wikipedia .org/wiki/Death_Valley.

[4] As an example, suppose six adults spend the following amounts on lunch {$12, $10, $10, $12, $11, $11} and six children spend the following {$4, $3.85, $4.15, $3.50, $4.50, $4}. The median (for an even number of observations, the median is sometimes taken as the mean between the two middle numbers, or in this case, the mean of 4.5 and 10) is $7.25. The mean and median are amounts that no one actually spends.

[5] See Gelman, A., et al (2008). Red State, Blue State, Rich State, Poor State . Princeton, NJ: Princeton University Press.

[6] These numbers are for white males and females. Non-white figures for 1850 are not as readily available. http://www.infoplease.com/ipa/A5140.html. An additional source of concern is that the U.S. numbers for 1850 are for the state of Massachusetts only, according to the Bureau of the Census.

[7] The title of this section, and the discussion, follows the work of Jenkins and Tuten very closely:Jenkins, James J; Tuten, J. Terrell. (1992). Why isn’ t the average child from the average family? And similar puzzles. American Journal of Psychology , 105 (4) Winter, 517–526.

[8] Stick-figure children from Etsy, https://www.etsy.com/listing/221530596/stick-figure-family-car-van-bike-funny; Small and large house drawn by the author; medium house from http://www.clipart best.com/clipart-9TRgq8pac.

[9] A simulation, see Tabarrok, A. (2014, July 11). Average stock market returns aren’ t average. http://marginalrevolution.com/marginalrevolution/2014/07/average-stock -market-returns-arent- average. html. Accessed October 14, 2014.

目录
设置
设置
阅读主题
字体风格
雅黑 宋体 楷书 卡通
字体大小
适中 偏大 超大
保存设置
恢复默认
手机
手机阅读
扫码获取链接,使用浏览器打开
书架同步,随时随地,手机阅读
首 页 < 上一章 章节列表 下一章 > 尾 页