世上万事万物都有自己的特征,以此便构成事物间的差异。对于在政策分析来说,汇集的原始数据中每一个元素也都与其它元素存有差异。从不同的角度寻找概括这些差异,探求数据信息的基本规律则是数据信息分析的第一步。
一、频数分布
频数是指按照不同频率出现的原始数据。原始数据从不同角度出现的次数或比例称为频数分布。数据信息分析的第一步就是要将无规则的原始数据整理成频数分布。在现实政策分析中,从某一时间点上对事物情况进行调查统计得到的数据组称为截面数据,而对某一时间段中事物变化状态进行统计得到的数据组称为时间序列。所谓频数分布是指以截面数据按出现频率分布的状态。不论是整理截面数据还是编排时间序列,都要以三个环节构成分析的基本过程。
第一,列出频数分布表或分布图,使复杂无序的原始数据呈有规律的分布。
第二,通过计算表示数据分布的集中趋势或中心点。
第三,通过计算表示数据围绕集中趋势或中心点的分布状态。
针对以上环节采用分组、概括、描述的方法进行数据处理,便构成数据分析最基本的内容。
(一)数据组的划分
将大量的原始数据整理成频数分布,首先要根据数据的不同特征将数据分组,使无规律的原始数据落入各个数据组中,以此表示数据分布的一个基本规律。如何确定数据组,这将取决于原始数据的性质和分析的目的。数据分组的角度是多种多样的。例如,假定针对N个原始数据进行分析。如果针对有关人员基本情况进行分析,则可将N个数据按照性别、年龄、种族、国籍、政治信仰、宗教信仰、婚姻、职业、收入、文化水平、……等多种角度进行分组编排,通过计算得出各组所占的人数和比例。如果针对房屋情况进行分析,则可将N个数据按照产权、房屋结构、建筑年代、……等有关可以反映房屋状况的角度进行分组编排,通过计算得出各组所占的房屋数量和比例。如表9·1·1所示,天津市2000年市区规划用地就是将原始数据按照16个项目分组,从而清楚地表示出规划用地的分布状况。
表9·1·1 天津市市区规划用地分组数据
项 目 面积(公顷)比例(%) 人均(M2/人) 项 目 面积(公顷)比例(%) 人均(M2/人)
工 业 5203.47 15.76 13.69 生活居住 8630.92 26.15 22.72
仓 库 963.17 2.92 2.53 科研设计 1172.58 3.55 3.09
对外交通 801.15 2.43 2.12 特殊用地 468.25 1.42 1.23
基建后方 723.74 2.19 1.90 生产绿地 3219.00 9.75 8.47
公用事业 1139.21 3.45 3.00 防护绿地 588.09 1.78 1.55
道路广场 3000.00 9.09 7.89 河 湖 1337.38 4.05 3.52
公共绿地 3026.00 9.17 7.96 村镇建设 960.00 2.91 2.52
公共建筑 1777.04 5.38 4.68 农田空地 ----- ----- -----
总 计 33010.00 100.00 86.87
表9·1·1说明,频数分布所记录的就是归入每个数据组的原始数据。例如“工业”数据组,则是2000年所有工业用地原始数据的总合。表9·1·1中是按16个项目将数据分组,并计算出每组数据占有限总体的比例即人均用量。根据每组数据还可以继续计算出其他有关的比例或数字。例如,“对外交通”这组数据中,还可进一步统计计算公路、铁路、机场、港口等个方面的用地数量和比例。每一项的展开都可以构成一个新的分组数据表。概括与展开到什么程度,取决于分析的目的。
(二)频数的“变量”表示
按照事物的单个性质或以类别分组统计的数据称为“离散变量”。表示一个范围性质的分组统计数据称为“连续变量”。在确定连续变量的范围时,一般是由两个数值确定一个范围,如果只用一个数值确定范围的一端,而另一端呈“开口”状态,即数据表示的是某特定数值以上或以下的状况,而不是两个数值范围内的状况,这种数据则称“累积变量”。例如,测定100名学生百米短跑成绩,分析学生身体素质情况作为决策参照,获得100个原始数据如表9·1·2所示,进一步则可以进行变量表示。
表9·1·2 100名学生百米短跑成绩(秒)
14.0 14。5 15。0 15。3 15。6 15。9 16。1 16。4 16。6 17。2
14.1 14。5 15,0 15。4 15。6 16。0 16。1 16。4 16。7 17。2
14.1 14。6 15。0 15。4 15。7 16。0 16。2 16。4 16。7 17。3
14.3 14。7 15。1 15。5 15。7 16。0 16。2 16。5 16。7 17。4
14.4 14。7 15。1 15。5 15。7 16。0 16。2 16。5 16。9 17。4
14.4 14。7 15。2 15。5 15。8 16。0 16。2 16。5 16。9 17。5
14.4 14。8 15。2 15。5 15。8 16。1 16。2 16。5 16。9 17。6
14.4 14。8 15。2 15。6 15。9 16。1 16。2 16。6 17。0 17。7
14.5 15。0 15。3 15。6 15。9 16。1 16。3 16。6 17。1 17。8
14.5 15。0 15。3 15。6 15。9 16。1 16。3 16。6 17。1 17。9
表9·1·2中100个数据的分布是单独的,即不互相涵盖也不相互连接,因此可以看作为100个离散变量。如果列表9·1·3,以一定的成绩范围分组并表示组内的频数分布,那将成为连续变量的分布。
表9·1·3 学生百米短跑成绩的连续分布
编组号 成绩范围(秒) 人数
1 14。0-14。9 18
2 15。0-15。9 33
3 16。0-16。9 36
4 17。0-17。9 13
5 18。0 0
总计 100
如果采用曲线表示学生百米短跑成绩的连续分布,则可如图9·1·1所示。
人数
100
40
30
20
10
0 · · · · · 成绩(秒)
14.0 15。0 16。0 17。0 18。0
图9·1·1 学生百米短跑成绩的连续分布
对于以上100个原始数据,如果分组的范围规定只有一个极限,那将在频数分布表中得到多个累积变量,使数据呈累计分布。一个累积变量中将包含一个范围极限以上或以下的所有原始数据。学生百米短跑成绩的累积分布,可如表9·1·4所示。
表9·1·4 学生百米短跑成绩的累积分布
编组号 成绩范围(秒) 快于范围的人数 慢于范围的人数
1 14。0 0 100
2 15。0 18 82
3 16。0 51 49
4 17。0 87 13
5 18。0 100 0
采用曲线表示累积变量的分布,可如图9·1·2所示。
人数
A:慢于范围人数累积 B:快于范围人数累积
100
80
60
40
20
0 · · · · · 成绩(秒)
14.0 15。0 16。0 17。0 18。0
图9·1·2 学生百米短跑成绩的累积分布
二、频数分布的描述
频数分布表或图示将原始数据按一定的要求分组,表示出各数据组之间的差异和联系,这种简单的方法,对于抓住问题有针对性地制定政策是必不可少的环节。但是,现实政策分析中对频数的把握不但要求抓住频数图表中表现出来的分布特征和规律,而且需要进一步描述频数平均分布和集中分布的状态,才能成为决策的依据。频数平均分布和集中分布的基本描述可以包括均值、中值、众数和离差的显示。
(一)均值
均值是指表示一组数据共性的数值,其目的就是要把大量的数据用平均的方法化简为一个数据,以此表述整组数据的特征。现实政策分析中使用数据的均值是相当普遍的。例如:人均收入、平均年龄、年均增长率、人均GDP等,都是数据的均值。根据数据特点和分析目的,均值可以有多种现实,其中最为普遍运用的是算术平均值和加权平均值。
1、算术平均值
算术平均值是最一般的均值概念,用变量值的总和除以变量的个数,便可得出算术平均值。例如:一组变量由5个数据n1、n2、n3、n4、n5组成,那么其算术平均值N则为:
N=(n1+n2+n3+n4+n5)/5
用以上公式求出表9·1·2中学生短跑成绩的算术平均值为15.85秒。如果我们将原始数据已经整理并列出了频数分布,且分组数据中的各个具体数值n i都已不在表中显示,那么再计算算术平均值将要复杂一些。这首先要以各组数据的代表值(中值)乘以该组中数据的个数,求出各组数值总值的估计值,再用各估计值的总和除以数据个数的总和。
若: N = 算术平均值 f = 各组中数据的个数
m = 各组数据的代表值(中值) n = 数据总和 =∑f
则: N = ∑mf / n =∑mf /∑f
例如,若根据表9·1·3中的数据连续分布求出学生短跑成绩的算术平均值,可如表9·1·5所示。
表9·1·5 学生百米短跑成绩的算术平均值
编组号 成绩范围(秒) 人数(f) 中值(m) mf
1 14。0-14。9 18 14.45 260.1
2 15。0-15。9 33 15.45 509.85
3 16。0-16。9 36 16.45 592.2
4 17。0-17。9 13 17.45 226.85
5 18。0 0 0 0
∑ 100 1589
根据公式N = ∑mf / n =∑mf /∑f,学生百米短跑成绩的算术平均值为15.89秒。表9·1·5显示出,在原始数据较多且已列出连续分布的情况下,以数据组为基础进行计算求出算术平均值要简洁和实用。但是,这种方法与直接计算原始数据相比,结果会稍有差异。
2、加权算术平均值
在现实政策分析活动中,一般的算术平均值有时不能满足需求,就要求出加权算术平均值。原始数据有时会受到一定因素的影响,影响因素则称为“权数”,在权数作用下求出的算术平均值称为加权算术平均值。加权数值在现实中使用非常普遍,企业的纯利润一般是销售额与纯利率互为权数计算的结果,高考成绩的“标准分”也是实际成绩加权计算的结果。加权算术平均值的计算可以表示如下:
若: Nw =加权算术平均值 n=组数据值 w =权数
则: Nw =∑(nw)/∑w
例如,某公司生产三种产品A、B、C,销售情况如表9·1·6,如果计算两种平均纯利率可表示如下:
表9·1·6 某公司三种产品的加权利润率
编组号 产品种类(f) 纯利率(n) 销售比例(w) 加权纯利率(nw)
1 A 0.05 0.2 0.010
2 B 0.06 0.2 0.012
3 C 0.07 0.6 0.042
∑ 3 0.18 1 0.064
平均纯利率=∑n /∑f =0.06
加权平均纯利率=∑(nw)/∑w=0.064
表9·1·6显示出,单项产品的销售比例W成为权数,由于权数W的作用,使平均纯利率和加权平均纯利率出现了差异。数据组越多,这二者的差异就越大。
(二)中值
中值也称为中位数,是一组按一定规律排列的数据“最中间”或“最中心”的数值,即数据组中的一般数据值大于它,而另一半则小于它。
1、原始数据的中值
对于未分组的原始数据,中值取按其值大小排列后中间一项的数值。即:
若:Md = 中值所在项 n = 数据个数
则:n为奇数时,Md =(1/ 2)n +1/ 2,中值即为此项数值。
n为偶数时,Md =(1/ 2)n &(1/ 2)n +1 即中值所在项有两个,中值则取这两项值和的二分之一。即:Md = {(1/ 2)n + [(1/ 2)n +1] }(1/ 2)
例如,一组数据有五项数值500、650、750、1050、1500,由于数据个数为奇数,即n=5,所以中值所在项为Md =(1/ 2)n +1/ 2 = 3,中值为750。一组数据若有八项数值500、650、750、1050、1500、1850、2010、2500,由于数据个数为偶数,即n=8,中值所在项为Md =(1/ 2)n &(1/ 2)n +1= 4&5,中值则取第4、5两项之和的二分之一,即Md = {(1/ 2)n + [(1/ 2)n +1] }(1/ 2)=1275。
2、频数组的中值
在频数组中,原始数据已经不复存在,据此计算中值将要复杂一些,计算结果也是一个估计值。由于频数是按大小顺序排列,我们可以先假设出中值所在的数据组,再假设各数据组中的原始数据呈等距均匀分布,中值则可以采用“内插”方法计算出来。例如,某地区100人每月工资外收入的连续分布如表9·1·7所示,采用内插法计算中值。
表9·1·7 100人月工资外收入的连续分布
编组号 组距(元) 人数(f)
1 0 - 200 20
2 210 - 400 25 ∑fp = 45
3 401 - 600 27
4 601 - 800 13
5 801 - 1000 8
6 1001 - 1200 7
∑ 100
在这100人的工资外收入中,虽然原始数据已经不存在,但中值极有可能位于第50-51人之间。从人数f的数据来看,第1、2组人数总和∑fp = 45人,那么中值显然位于第3组之中。如果假设第3组中27人的收入呈等距分布,则可以在1/27处插入,以确定中值。
若:Md = 中值 Lmd = 中值所在组的数值下限 Fmd = 中值所在组的数数据个数
∑fp = 中值所在组以下各组数据个数之和 ∑f = 原始数据之和 i = 组距
则:Md = Lmd + (n / 2-∑fp) (1 / Fmd ) i
根据表9·1·7所示,Lmd =401,Fmd =27,∑f =100,i =200,∑fp =45,则:
Md = Lmd + (n / 2-∑fp) (1 / Fmd ) i
= 401 +(100/2-45)(1/27)(200)= 438
(三)众数
众数是指出现次数最多,及频率最高的原始数据,表示着数据分布的一种集中趋势。对于未分组的原始数据来说,一般不确定众数,因为出现次数最多的原始数据有可能处于全部原始数据排列的极端位置,因而将丧失代表性。对于频数组来说,原始数据也不复存在,要找出众数也已经不可能。不过,在组距相等的情况下,所含原始数据数量最多的一组可被视为众数组。众数组的组中值可视为众数的估计值。如果将均值、中值与众数组的位置综合起来分析,则不仅会显示出频数分布的集中趋势,而且会显示出频数分布的偏斜度。
在极限状态下,离散变量的分布可以被看作连续的曲线分布,众数则可以被认为是曲线最高点下方所对应的横轴上的数值。这一点可如图9·1·3所示。
数据频率
原始数据
M0
图9·1·3 众数的位置
如果具有不同性质的基础,则可以出现多重众数分布。例如,不同性别的人数比例、不同工作性质的薪金收入、不同产品的成本或价格等,若按同一性质计算众数将失去意义。这些例子中可能会出现两个或两个以上的众数。在多重众数分布下,究竟哪个众数代表频数分布的集中趋势,则组要认真处理。多重众数可如图9·1·4所示。
数据频率
原始数据
M1 M2
图9·1·4 多重众数分布
由于众数在频数分布中的位置正是变量最集中的地方,所以通过它可以对均值和中值的代表性进行判断。如果数据在坐标上呈对称性均匀分布,那么众数与均值、中值为同一数值;如果数据在坐标上呈偏斜的极端分布,那么均值、中值都会远离众数而偏向极端值。其中,均值受极端值的影响最大。这一点可如图9·1·5所示。
数据频率
B A C
原始数据
M0 Md N M0 N Md M0
Md
N
图9·1·5 不同分布状态下的均值、中值与众数
在图9·1·5中,曲线A表示正态对称分布,均值、中值、众数为同一数值;曲线B表示右偏或正偏分布;曲线C表示左偏或负偏分布。在偏态分布下,越偏向极端的一方,均值离众数、中值就越远,代表性就越小。
(四)均值、中值、众数的比较
均值、中值、众数都表示着频数分布的集中趋势,但是又都有不同的意义与特点。
均值最普遍地代表集中趋势。其优点在于它是一个严格规定的数学值,可用数学方法求得和处理。对于一组原始数据的均值可用数据值总和除以数据个数求得;对于两个或两个以上有关的均值可以通过加权计算组合在一起。例如,沿海地区10个城市职工月平均收入2000元,内地20个城市职工月平均收入1000元,那么这30个城市职工月平均收入可通过加权计算求得。即:
Nw =∑nw /∑w = (2000×10+1000×20) / (10+20) =2000(元)
相反,如果从中值出发便无法将两个中值处理成一个中值。均值的这一特点使其在政策分析中得到最普遍的运用。均值的缺点是它会因为受数据极端分布的干扰而失真。例如,5%、10%、20%、25%、90%这5个数据的均值为30%。很明显,由于90%这一极端数据的出现,使均值偏向了这一方,大于前四个数据。这样就失去了意义。如果一个单位的行政人员年终奖金是全单位奖金的平均数,若出现一个较高的极端值,那将把均值提高而使行政人员获益。因此,为了摆脱失真的均值,往往去掉数据的最高值和最低值再加以平均,从而得到一个摆脱极端数据影响的有意义的均值。
中值也是频数分布集中趋势的代表。它的优点在于不受极端偏态分布的影响。影响中值的主要因素是数据的多少,而不是数值的大小。不论极端数值多大,中值不会受其影响而改变。这一特点优于均值。中值的缺点在于其仅是一个中间位置上的数值,没办法进行进一步的数学处理。若已知两个或更多的有关分布的中值,欲求出综合中值在数学上是不可能的。
众数以数据出现的频率次数最多来表示频数分布的集中趋势。通过它可以判断中值和均值的偏斜状态,以衡量后者的意义有多大。但是,众数的多重分布使之与均值和中值出现较大的差异,从而无法表示真正的集中趋势。面对众数的多重分布,如果不能分解为多个单一的众数分布,多重分布也有可能失去意义。
在现实政策分析活动中,对于数据集中趋势的分析,一定要仔细判定采用哪种描述最为正确,否则将会出现分析的失误。例如,下列情形应该采用的描述分析方法值的思考:
A、确定某企业5年间的废品率,可以采用加权算术平均值来计算。以每年的产品数对每年的废品率加权,再用加权值的总和除以5年废品率的总和。
B、根据平均收入确定收入相对较好的一半人员,可以采用中值计算。一般说来,以中值为界,高于和低于中值水平的人员将各占一半。
C、根据5个城市的各自人口出生率计算5个城市的综合人口出生率,可以采用加权算术平均值来计算。以各城市的人口数对个城市的出生率加权,再以加权值总和除以出生率总和。
D、如果从某高架公路桥下通过的机动车高度呈极端偏态分布,那么绝对不可以车辆高度分布的集中趋势来取定建桥的高度,桥梁底面只有超过车辆的极端高度才能保证一切车辆的通行。
E、某单位因高薪聘用人才使工资呈极端偏态分布,若确定一个具有代表意义的数据则可采用中值计算。因为中值比较均值来说,不受极端高值的影响,所以代表性较强。
三、频数分布的离散度
离散度是指原始数据与中值或均值的分离程度。中值与均值作为一种频数分布的集中趋势,必然使得原始数据或分组数据围绕它们分布时出现不同的分离和差异。离散度就是对这一差异的描述。
(一)四分位区间
四分位区间是采用分位数计算方法表示的数据分布与中值离差的描述。对于一个按顺序排列的数据系列,可以将其分成若干份,每一份的最高项数值便是一个分位数。因此,分位数就是指包含数据某一特定份数的数值。例如,在一个数据分布系列中,第二个四分位数是包含数据总项数2/4那一项的数值,第九个十分位数是包含数据总项数9/10那一项的数值,第九十九个百分位数是包含数据总项数99/100那一项的数值。在现实政策分析中,最普遍采用的是四分位数,即将数据分布等分为四份,以此计算数据与中值的离散度。
四分位区间是指第三个四分位数与第一个四分位数的值差区间。第三个四分位数称“上四分点”,包含总项数的3/4,因此有3/4的数据在其下,有1/4的数据在其上。第一个四分位数称“下四分点”,包含总项数的1/4,因此有1/4的数据在其下,有3/4的数据在其上。上、下四分点之间称“四分位区间”。一般说来,四分位区间包含了数据的2/4,即一半数值的分布,同时也包含了中值、甚至均值和众数。四分位区间的确定比较简单,可如以下公式所示:
若:N=数据个数
则:下四分点=N/4 上四分点=(3N)/4 中值=(2N)/4
四分位区间=(N/4 —(2N)/4 —(3N)/4)
四分位区间包含了一半数据围绕中值的离散分布,因此很有代表性。著名的德尔菲预测法是四分位区间最典型的运用。
(二)原始数据的平均离差
原始数据的平均离差是指原始数据围绕均值分布时出现不同的分离和差异的平均值,包括平方差和标准差。平方差是指原始数据或分组数据与均值之间差的“平方和”除以数据个数所得的结果,标准差是平方差的平方根。对于原始数据来说,平方差和标准差的计算可采用以下公式:
若: Q2 =平方差 Q=标准差
XI =原始数据 I=1, 2, 3, ……,n
N=原始数据均值 n=原始数据个数
则: Q2 =[(x1-N)2 +(x2-N)2+……(xn-N)2] / n
=∑(XI -N)2 / n
Q = ∑(XI -N)2 /n
例如,一组5个原始数据10、15、20、30、50,均值为25,求出其平方差和标准差:
Q2 =∑(XI -N)2 / n = ∑(XI -25)2 / 5 = 1000÷5 = 200
Q = ∑(XI -N)2 /n = 200 =14。14
(三)分组数据的平均离差
对于已经分组的频数来说,原始数据已经不存在,为了适应频数情况,平方差与标准差的计算公式可调整如下:
若:Q2 =平方差 Q=标准差
f=分组频数 m=各分组数据中值 N=全部数据的均值
n=数据个数=∑f
则:Q2 =[∑f(m-N)2 ] / (n-1)
Q= [∑f(m-N)2 ] / (n-1)
例如,根据表9·1·5中学生百米短跑成绩的频数分布数据,已知均值为15.89(秒),求出其平方差与标准差,可如表9·1·8所示。