找回密碼
 入住家園
查看: 790|回復: 0

【转帖】浅谈统计法在音韵学研究中的应用

[複製鏈接]
發表於 2005-11-12 20:13:01 | 顯示全部樓層 |閱讀模式
音韵学研究中的统计法

统计法纯粹是数学方法,把它移植到汉语音韵学领域以处理大规模的音韵资料,可以说是现代音韵学与传统音韵学的重要区别之一。音韵学研究者使用的统计法,大致可以分成三类:一类是算术统计;一类是概率统计;一类是数理统计。

一、算术统计

算术统计:这个方法在音韵研究中运用得最为普遍,这种统计法一般是运用初等数学中的一些简单的算法,计算各种情况下出现的次数、频率,并进而计算百分比。一般来讲百分比达到百分之十,即看做语音有变化。这种计算方法就是日常中最熟悉、使用最广泛的统计方法,就是求百分比。可是百分比的计算却并不是这样简单地。比如说分析一组样本,我们要探讨[n]韵尾的情况,共有1647个例子,其中[n]韵尾占842个,其百分比是51.12%。这样的结果往往与均值有很大的出入,即使这个百分比求出来了,其结果也是要商確的。另外这里我们还要引进另一个概念,就是加权平均数,例子的分量是不一样的。以前我们一般不把不同类的语音现象放在一起研究,例如同一本书中,可能有直音,也可能有反切,还可能有韵文。一般的做法就是每类进行单独探讨,可是如果我们引"权"的概念,所有的样本分类就可以放在一起探讨,那样就会有不同的结果。另外,在这种统计方法中,一定要把百分比与均值结合起来考虑,与此同时,我们应该引入众数的概念。因为一组出现次数最多的值往往会支配样本,这样无论是中位数还是均值以及百分比都会产生误导,除非众数位于中心位置。

二、概率法

概率法:用概率相逢数公式来研究声韵的分合。

A、B分别代表两个声母(或韵部、声调)的通转次数,N代表所有的声母(或韵部、声调)的通转总数。例如:简牍帛书通假字中,之部与职部的概率为63.1:
A(之部)=2279;
B(职部)=750;
N=27092

最初利用概率法研究汉语音韵的是已故的陆志韦先生。现在很多学者在进行谐声字、假借字、韵文叶韵的出现概率规律时,多用此公式加以计算。此方法对考察音韵大势是很有帮助的。

在概率统计中,我们首先要确定总体,所谓的总体也就是某一变量的所有可能的值的集合。而一个样本应该是总体的代表,不应该因潜在的或明显的偏倚而在构成上同目标总体迥异。在总体中我们要抽样,随机抽样并非指样本中的事件是偶然的、完全无序的,而是指按照一定的步骤来构造样本,使得总体中的每一个元素都有一定的被选中的概率。如果我们的样本不是按照随机抽样的步骤来构造的,就无法确信能够从中得到的推断是否接受于所关注的总体值,因而任何概括都是值得怀疑的。蒋希文先生《徐邈音切研究》中使用了"枚举归纳推理",他的抽样方法就无法让人信服。当然蒋先生用的不是概率统计法,但是如何抽样是概率统计中关键所在,不能只套用一个公式,而要将所有的因素考虑周全。

三、数理统计法

在算术统计和概率统计研究方法运用的基础上,近年来有学者又将数理统计法用于音韵研究。数理统计法处理随机现象,比前两种方法更为精密。目前见于音韵研究的主要是t检验和x检验(卡方检验)两种办法。

1. t分布假设检验

朱晓农先生运用了数理统计中的t分布假设检验,讨论北宋豫鲁地区词人用韵的分合——分辙与分组问题,取得了较好的研究结果。该方法大致如下:

(1)确定统计单位:韵次和字次;
韵次(记为Y):相邻的两个韵脚相押一次为1韵次。
字次(记为Z):一个韵脚每押一次为出现1字次。
韵次是从两个韵脚之间算的,字次则是从每个韵脚的角度算的。例如:两个相邻的韵脚"招"和"桥",算宵韵字自押1韵次,而对"僚"字来说,与"招"相押是它的1字次,反过来对"招"来说,与"僚"相押是它的1字次。字次与韵次的关系是Z=2Y。

(2)用概率计算确定离合指数;
辙离合指数计算:"辙"是指韵部,计算两韵或两辙之间是否应合为一辙所依据的公式为:

(Y是指韵谱中各韵的全部韵次,Z是指韵谱中各韵的全部字次,Yab是指A、B两韵(辙)互押韵次,Za指A韵(辙)的全部字次,Zb指B韵(辙)的全部字次。计算结果如果等于1,就说明两韵(辙)之间的实际互押频率与所有韵字互押的理论平均概率持平。一般来说只要计算结果达到和大于2,即可认两韵(辙)已经合并。

韵离合指数计算:

P是假定A、B两韵合并时,它们之间在理论上会达到的平均互押概率;R是两互押韵次与两韵总韵次的比例;I是韵离合指数。当I≥100,两韵合并,也就是韵基相同,不涉及介音;当I≥90时,已可以认为合并,当I<50,就是分立的;如果50≤I<90时,就需要用T分值假设检验来确定其是分是合。

(3)t分布假设检验。
t分布假设检验的原理是看一个在原假设的前提下,理论上出现概率很小的情况是否出现,如果出现,就拒绝原假设,如果不出现,就接受原假设。首先要对材料分组,然后计算互押韵次之和的比例,n为样本数。公式如下:

求出样本均值:

求出修正方差:

计算统计量:

然后需要设定检验水平α,也就是"小概率"。α一般取0.025。从"t分布临界值表"查索临界值t2a(n-1)。如果│t│<t2a(n-1),就表明原假设成立,实际比值与标准比值无显著差异,两韵合并;如果│t│>t2a(n-1),就说明原假设能成立的概率仅为2.5%,应认为两韵不合并。

2. 卡方检验

美国汉学家白一平在《汉语上古音的*-u和*-iw在〈诗经〉中的反映》一文中运用了卡方检验讨论了《诗经》押韵幽部字中*-u和*-iw两个韵线的分野,对上古音研究很有启发意义。

(1)确定统计单位:
韵对:相邻两个韵脚之间构成一个韵对。

(2)计算公式:

O是观察频数,E是理论频数。在研究a、b两韵互注时,分别套入a韵的自注数Oaa,b韵的自注数Obb,以及两韵的互注数Oab,得出理论频数Eaa,Ebb,Eab。

Eaa=(Oaa+Obb+Oab)*[(2Oaa+Oab)/2(Oaa+Obb+Oab)]²
Ebb=(Oaa+Obb+Oab)*[(2Obb+Oab)/2(Oaa+Obb+Oab)]²
Eab=(Oaa+Obb+Oab)*2[(2Oaa+Oab)/2(Oaa+Obb+Oab)][(2Obb+Oab)/2(Oaa+Obb+Oab)]

然后确定检验水平α=0.025,即做出此判断有97.5%的可信度。α可以定得大一些,也可以定得小一些,如果定得大一些,对两韵分立的标准就放松些,对两韵相混的标准就抓严些。相反,如果定得小些,对两韵分立的标准就抓严些,对两韵相混的标准就放松些。然后查X²分布临界值表。确定自由度,由临界值表中查得临界值,拿它与计算所得的卡方值做比较,如果卡方值大于临界值,则两韵分立,如果卡方值小于临界值,则两韵相混。

四、问题与思考

在这里我要提出几个问题:

第一,这两种统计法的前提是所考察的样本必须是正态分布,可是我们音韵学研究中却绝对不可能出现正态分布曲线的。当然,任何变量都可以成功地模型化为一种正态分布,只要变量的值是作为几个独立的成分的值的求和结果而出现。

第二,置信区间的选择。我们可以看到这两种方法的应用中,置信区间的选择非常机械。在选择上人为地定97.5%的可信度。很多人会为这个数字感觉到疑惑,为什么我们就要选择这个置信区间,这个置信区间就最为合理吗?在数理统计上,有着专门计算置信区间的办法,因此我们在使用这两个方法时应该按照严谨的科学程序,计算几个置信区间,从中选出最为合理的,这才是统计的前提。

第三,如何来确定样本。在这两种方法是以"韵次/韵对(字次)"为统计单位,这是应用数理统计的基础。可是这种方法只计算相邻韵脚押韵的关系,而把非相邻韵脚之间的关系完全排除在研究视野之外,这样做明显不合理。我们现假设有这样一个韵段:ABCD。按照这种算法,会计为两个样本AB和CD。那么A和C就没有关系了吗,A和D不算混用吗?这样的样本选择明显是有缺陷的。我本人认为对于样本的选择应该用随机取样的办法,这样我们就可以得到AB、AC、AD、BC、BD、CD六个样本,这样即使样本和总体的容量很小,样本的总数却可能很大。样本的数足够大,就有可能呈正态分布,那样统计上的其他问题就迎刃而解了。

第四,T分值统计法在运用时,分组工作非常繁琐,有时数据分组情况有小小变动,对统计量的影响就会很大,甚至得出相反的结果。相比之下,卡方检验减少了对原始数据的人工干预,统计结果可靠性较强。但是两种统计法都有这样的问题存在,当原始数据量较小时,结果不甚可靠。因此在运用数理统计法时,一要有敏锐的音韵学观察力,二要熟练掌握这两种计算方法。而且应该将这两种计算方法联合起来使用,要在离合指数计算的基础上再应用卡方计算法。也就是说只有当韵离合指数在50到90之间时才作卡方检验。综合两个统计方法的优点,先算出较严谨的韵离合指数,舍弃繁琐的T分值检验,而代以卡方检验,将会使分析结果更为科学可靠。

第五,运用卡方和t分值计算时,观察值的独立性特别重要。所有记录下来的例子必须是相互独立,没有任何联系的。然而我们在讨论音韵学问题时往往忽略了对独立性的探讨,所以我们虽然能够求出数理统计的结果,但同时我们应该对语音发展的脉络非常清晰,在数理统计的理性分析的基础上,加上个人的判断,才会得到较为科学的结果。在音韵学研究中难免会遇到样本量小的情况,这时,对于小的期望频率必须做出校正。因为从数学上可以证明:如果检验的模型是正确的,那么总异常值会近似于有关自由度的卡方分布。当表大于2*2,而期望频率足够大时,就会非常接近卡方分布。当表仅有2行2列时,总异常值会远大于其分布能很好地模型化为一个自由度的卡方变量本应有的异常值。

任何一种统计方法都有其盲区和无法解决的问题,我们应用的时候首先要考虑这种方法的适应范围,不能生搬硬套。尤其是不能抓着一个公式就盲目地应用,我们研究的是音韵,统计法只是让我们的研究更为科学化,如果我们错误地使用了统计法,将会直接影响我们的音韵学研究成果。本文只是提出一些问题,但对这些问题的具体解决方法还没有解答,希望给予批评指导。
您需要登錄後才可以回帖 登錄 | 入住家園

本版積分規則

手機版|小黑屋|吳語書院

GMT+8, 2026-9-4 18:55 , Processed in 0.023120 second(s), 16 queries .

Powered by Discuz! X3.5

© 2001-2026 Discuz! Team.

快速回復 返回頂部 返回列表