找回密碼
 入住家園
查看: 857|回復: 5

【转载】米阿仑:从信息熵角度看中文软件和中文信息业的发展

[複製鏈接]
發表於 2005-12-11 21:44:11 | 顯示全部樓層 |閱讀模式
从信息熵角度看中文软件和中文信息业的发展(上)

作者: 米阿仑
[ 2001-09-19 17:25 ]
【导读】像《起来:挑战微软霸权》那样抒发一下民族感,是合情合理的。但是,这些都不能代替科学技术的发展。中文信息产业的命运究竟如何,还得从信息科学技术那里寻找答案。否则,热情之后,一切照旧,中文信息产业还是被动的。为此,来自纽约的米阿仑从信息科学技术的角度说明了微软公司中文产品的问题和潜在威胁。
编者按:亚都一案了结以后,人们会看到中文软件还是微软公司的天下。像《起来:挑战微软霸权》那样抒发一下民族感,也是合情合理的。但是,这些都不能代替科学技术的发展。中文信息产业的命运究竟如何,还得从信息科学技术那里寻找答案。否则,热情之后,一切照旧,中文信息产业还是被动的。为此,来自纽约的米阿仑从信息科学技术的角度说明了微软公司中文产品的问题和潜在威胁。作者认为,软件产业不过问信息熵问题,就好比是汽车产业不过问马达功率、建筑产业不过问材料问题一样。

一、引言
二、信息熵的来历、基本概念和方法
三、信息熵的意义
四、超级计算机能提高汉字方式的效率吗?
五、信息熵:鉴别微软公司中文产品的有力工具
六、文艺复兴:中文信息产业基础建设的战略条件

一、引  言
   前些时候,我读到一些报导说,在中国软件市场,80年代是中文操作系统竞争,90年代是中文输入法竞争,从现在起,是办公室套件竞争。这个竞争线条,是按照微软公司中文产品的发展来描绘的:系统和基础科学技术的标准问题,微软公司已经解决,剩下仅仅是如何开发应用软件市场了。
   然而,仔细考察微软公司的中文软件系列(包括系统软件),就能发现基础科学技术方面的错误(不是打补丁就能修补的臭虫)。这些错误对中国的软件市场、语言文字工作、文化教育事业和有关科研方面造成的误导相当严重,以至于指明这些错误和做科学探讨都成了非常困难的事情。如果把中文软件工业比喻作一棵参天大树,那么,微软公司中文系统的错误就出在树根上:微软公司在设计制作中文软件的时候,忽略了信息科学技术的基础课题:信息熵。
   “千年虫”(Y2K)是基础建设过失造成的“定时炸弹”。这颗炸弹只涉及表示年份的两个字节,受威胁的只限于跟年份有关的数据和操作。正是为了纠正这两个小小字节的错误,从1998年年初到现在,全世界已经消耗了将近一万亿美元,人力投入无数,随着Y2K 的临近,消耗还在增加。
   微软公司中文产品系统的错误是“定量炸弹”。这颗炸弹涉及的不是两个字节,而是整个系统的基础。把它称“定量”,是因为没有达到一定信息产业的产品数量和技术要求的程度,就很难看到这颗炸弹的潜在威胁会造成多大损失。这颗炸弹可能很快起爆,也可能要等一段时间,全看中文信息产业发展如何。一旦起爆,那就不是两个字节的问题,而是整个系统以及这个系统下的全部数据和操作的问题,其威胁比Y2K 要大得多。
   微软公司产品的发展线条不能代表中文信息产业发展的实际和需要。如果不搞好基础建设,继续忽略信息熵的基本原理和方法,那么,中文信息产业相当大的一部分很可能有一天会毁于微软公司的“定量炸弹”。
   中国早在70年代就完成了中文信息熵的基础工作,80年代基本上完成了大规模的中文信息熵研究工作。这些,本来应该是中文软件工业发展的科学技术基础。然而,面临信息时代的挑战,一些报刊杂志望文生义地使用信息论的一些术语和词汇宣扬“汉字优越”,为微软公司控制中文软件市场提供了文化条件。这些年来,微软公司的中文系统被误认为“标准”,几乎成了一种迷信,迫使许多中文软件厂商为幸存而奔忙,无暇顾及基础建设。内外因素结合的结果是,中文软件产业和有关的科学研究几乎成了微软公司中文产品大树的枝和叶,一旦这棵大树根基的“定量炸弹”引爆,后果不堪想象。
   这篇文章试图破除微软迷信,说明信息熵对中文信息产业和中文软件发展的重要意义,同时,希望中文软件厂商能更多过问科学技术的基础问题,把微软公司误导的中文软件市场转移到正确的轨道上来,也希望中国政府有关部门在制定软件工业标准的时候,要特别关注中文信息产业的基础建设。

二、信息熵的来历、基本概念和方法
  美国的信息产业能有今天的称雄世界的实力,能接连不断地产生新的技术产品,是跟坚实的基础建设分不开的。这个基础建设的科学技术的基本依据,是信息科学技术的基本原理和方法:信息熵(ENTROPY)。
  第二次世界大战期间,美国为了提高信息储存和传递的效率,发明了多种新的编码方法,奠定了现代信息科学技术的基础。战争结束后,这些方法得到了飞跃发展。在这些方法当中,科学家闪农和霍夫曼提出的信息熵和数据压缩的理论和方法最能代表现代信息学的基本概念。个人计算机和BBS 问世以后,信息熵和数据压缩技术迅速普及。现在,这种技术已经成为计算机和联网必不可少的组成部分。
   这里用闪农最喜欢用的猜谜方法(类似语文教学的填空练习)来说明信息熵的基本概念。假如有:
   我们大__都喜__使__计__机。
不用很多努力,就可以猜出完整的句子:
   我们大家都喜欢使用计算机。
  闪农指出,能猜出来的字符不运载信息,而不能猜出来的字符运载信息。空格所隐藏的字符属于多余度字符,不用那些字符也能运载该句子的全部信息。多余度大小对信息阅读和检错抗错有重要的意义。比如:
   我__大________使______机。
就很难猜出完整的句子,在信息传递的时候,也很难做检错和抗错。因此,保留合理比例的多余度是非常重要的。
   信息熵方法的基本目的,是找出某种符号系统的信息量和多余度之间的关系,以便能用最小的成本和消耗来实现最高效率的数据储存、管理和传递。
   信息熵是数学方法和语言文字学的结合,基本计算公式是:
   H = — LOG 2(P)
   其中:H 表示信息熵,P 表示某种语言文字的字符出现的概率,LOG 2是以二为底的对数,用的是二进制,因而,信息熵的单位是比特(BIT,即二进制的0和1)。
   50年代,现代信息论介绍到中国;70年代,中国科学家完成了中文汉字字符信息熵的初步计算工作,80年代又做了更完整的计算。他们的基本方法是:逐渐扩大汉字容量,根据随机试验结果的各种概率,使用公式
   H = — E(n, r=1) LOG (2) P (r)
   来计算熵值H。公式中,H 是静态信息熵,E(n, r=1)是从r 到n 个结果的和,LOG(2)是以2为底的对数,P(r)是第r 个结果的概率。这个公式是基本公式的一般静态方法,求到的数值是静态平均信息熵。中国科学家冯志伟等人的计算的结果是:
   汉字容量:1 1052  1830   4912   5104  5211  12370
   信息熵值:0  7.53   9.52   9.61   9.63   9.64   9.65
  随着汉字容量增大,信息熵的增加趋缓;汉字增加到12370以后,不再使信息熵有明显的增加。通过数理语言学中著名的齐普夫定律(ZIPF'S LAW)核算,这些中国科学家指出,汉字的容量极限是12366个汉字,汉字静态平均信息熵的值(平均信息量)是9.65比特。这是当今世界上信息量最大的文字符号系统。下面是联合国五种工作语言文字的信息熵比较:
   法文: 3.98比特
   西班牙文:4.01比特
   英文: 4.03比特
   俄文: 4.35比特
   中文: 9.65比特
   可以看出,拼音文字的信息熵小,差别不大。汉字的信息量最大,因而,在信息管理和传递的时候,中文处于最不利的地位。

三、信息熵的意义
a.数据储存
   信息熵原理的直接意义是为信息工程设计提供科学技术的基本依据。就此来说,静态平均信息熵是基础的基础。例如,在为中文数据管理和传递设计硬件和软件的时候,首先要根据汉字静态平均信息熵决定如何储存和使用多大的空间来储存汉字字符。汉字的平均信息熵是9.65比特,每个汉字字符需要两个字节(一个字节等于8 比特)。汉字总量大约有五万六千个,需要十多万个字节才能保证中文信息的储存和传递有足够的待用字符。目前的中文字库包括二万多个汉字字符,占用将近4.5万个字节。尽管这个字库还没有包括所有的汉字字符,却已经是世界上消耗最大和成本最高的字符系统了。此外,汉字还在不断增加,每增加一个汉字就等于增加一个新的字符,需要增加一个字节来储存。这意味着汉字字符方式很难为中文信息管理建立长期稳定和规模合理的数据标准,是中文软件产业发生“万码(马)奔腾”现象的主要技术原因之一。
   英文等拼音文字的平均信息熵大都4.5个比特以下,每个字符只占用一个字节。例如英文,一共有26个字母字符,大小写和各种标点符号都算上,只要90个字节左右就够了,不到中文字符消耗的千分之一。此外,在增加新的词汇的时候,这些拼音文字不需要增加新的字符,也不需要增加新的字节消耗,因而能够建立长期稳定和规模合理的数据标准。这是英文等拼音文字方式更适合信息数据管理的基本技术因素,也是英文等拼音文字软件产业没有发生“万马(码)奔腾”现象的主要技术原因之一。
b. 数据管理
   信息熵大小的另一个重要意义是表明某种字符系统的效率。一般说来,某种文字的字符信息熵越大,原始数据输入的工作量有可能变得越小,而整体工作效率就越低。
   这里用二进制和十进制的数字信息管理说明。二进制只有两个符号,0和1,是规模最小和非常单一稳定的标准,可原始数据输入的整体工作量也是最大的。比如99这个数,二进制输入是“1100011”,要七个字符。用十进制,输入是“99”,两个字符。可是,十进制需要十个数字符号做标准,比二进制的规模大得多。
   在做数据管理的时候,二进制的功能强,灵活,而且非常简洁。 然而,二进制的多余度最小,人阅读起来很困难。十进制的多余度大,适合人类阅读。因此,机器用二进制作业,人用十进制阅读。
   这个对比说明,使用信息量大的字符系统,原始数据输入工作量可以降得很低,其代价是总体效率大大降低。如果信息量过大,那么,该字符系统就有可能仅仅用来作数据储存和检索,用来作数据标准,就有很多困难,甚至会失去作标准的可能和意义。
   不同信息量的字符系统可以有近似的多余度。据有关专家计算,中文和英文等拼音文字的多余度基本接近。计算方法是:
   R = 1 — H(LMT)/H(0)
   其中,R是多余度,H(LMT)是极限熵,H(0)是平均最大熵。由此计算,汉字的多余度是56%到74%,平均值是65%左右。美国专家BURTON和LICKLIDER 根据闪农的试验方法,算出英文的多余度在67%到80%,平均为73%左右。中国信息学和语言文字学专家冯志伟和尹斌庸等人指出:多余度高使语言文字精密,太高了就会造成学习和使用的烦琐与浪费;中文和英文等拼音文字的多余度相差不大,说明它们的精密度相差不大,因而不存在语素方面的孰优孰劣的问题(即“汉字优越”是没有科学根据的说法)。可见,造成汉字方式整体效率低的基本因素不是多余度,而是信息熵。这才是问题的核心。
c. 数据传递
   计算机信息传递有两种方式:并联和串联。并联方式是:一个字节的八个比特同时传递,好像八座门同时打开,八个人同时进出。并联多用在小范围和短距离的数据传递,例如:计算机和印刷机的联接,一个办公室或一个办公楼内部的计算机联网,等等。并联的好处是速度快,缺点是成本高。比如,在两个城市或两个国家之间用并联,那么,光是电缆的成本就高得很,更不要说有关的设施和维护了。无线传递为并联传递提供了更多可能,但是,具体到收发个体,还是有线并联传递更合算。
   串联的方式的成本比并联的要低的多,因而,在大范围和长距离的条件下作数据传递,大都用串联。串联传递的时候,字符的字节是按照一个个比特来传递的,即一连串的0和1。通讯收发到一定比特数量,必须确定一个字节是否传递完毕,以便将一连串的0 和1 转换为人可以阅读的字符。例如,在异步传递一个字节的时候,各个比特的功能是:
  0   1001101  1   1
 开始  数据   奇偶 停止
   英文等拼音文字的的平均信息熵小于4.5比特,一个字节有八个比特,因此,可以将剩余的比特用来作奇偶检验和抗错。中文的汉字方式需要两个字节,在建立字库的时候,两个字节的比特全都用满了,没有剩余的比特来作奇偶检验和抗错。这是中文网络通讯中很容易出现坏码(不是乱码)的基本原因之一。乱码没有编码损失,可以通过兼容来避免乱码,或者通过字节重新组合来挽救信息损失;而坏码是编码本身的损失,消减甚至丧失了兼容和字节重组的可能,很难挽救信息损失,即便能做些弥补,成本也是非常高的。

从信息熵角度看中文软件和中文信息业的发展(下)
作者: 米阿仑  
[ 1999-07-10 00:00 ]
  为了满足多种语言文字网络通讯和防止坏码的需要,国际网络电子邮件广泛采用MIME方式传递数据。MIME方式的基本工作原理是:按照一定的进制,将所有字符转换成国际通用的七比特ASCII 字符(7 BIT DATA,剩下的一个比特作奇偶检验),以便能保证传递数据的兼容和无损。
   MIME方式通用于所有的计算机和网络渠道。英文等信息熵小的拼音文字本身就使用ASCII 纯文本字符,不需要MIME转换。中文字符信息熵大,没有MIME转换就很容易出现乱码或坏码。转换是有成本消耗的,而汉字方式的成本消耗是世界上最大的。

四、 超级计算机能提高汉字方式的效率吗?
  随着计算机的速度、储存和兼容能力等个方面的提高,中文信息管理和传递的困难是否会自动得到解决呢?不一定。例如,即便我们用四个字节来作国际标准字符集(国际标准组织已经多次提出这个方案),使每个汉字有足够的比特剩余来作奇偶检验和特性参数,让所有的计算机和操作系统都能使用,然而,数据全面管理和传递的效率问题依然存在。原因是:
  (一)中文数据的文字方式决定了标准的多重性和规模过大,而且,只要汉字还再增加,它的字符集就是不稳定的。不管一个字符用多少字节,也不管计算机的储存容量有多大,也不管各种系统的兼容有多么全面,这样的字符集做数据储存和检索还可以,做全面的数据管理就总是有严重问题。
  (二)不管用什么中文输入方法,汉字输入输出的字符仍然需要多次转换,还是高成本和高消耗的。现有的中文输入方法跟语言文字的标准规范之间的差别依然存在,人的操作和学习等效率还是没有得到提高。电笔输入作鉴别(如签字)的效果很好,但是,如果数据规模大,效率就不如键盘操作。声音输入作指令和小规模数据输入还可以,做大规模数据输入,就会因为劳动强度太大而不现实。更重要的是,键盘操作对思维的影响很小,而声音操作的脑力消耗比键盘操作的大得多,严重地妨碍思维。微软公司说,它的多媒体电笔和声音输入可以让中文输入更轻松愉快,那是商业夸张。电笔和声音输入是重要的技术,但是,这些技术突破并不能取代键盘输入,更不能解决中文的效率问题。
  (三)拼音文字的每个字符只要一个字节,现在用两个字节的联码(UNICODE),已经有一个字节是多余的,在做数据处理和传递的时候,为此多支出了一倍的成本(包括处理多余字节的程序消耗)。这些多余成本基本是为了迁就中文等亚洲文字的需要。如果用四个字节,就有三个字节是多余的,使用拼音文字就要多支出三倍的成本。在可见将来,各方面的发展能否抵消这些多余成本,还不清楚。拼音文字的母语国家是否乐意为了中国汉字的需要而继续牺牲自己的利益来年复一年地支出更多和毫无回收可能的成本,也不清楚。
  (四)通讯传递中,汉字字符由双字节变成了四字节,使原来的成本和消耗增加了一倍,平衡或抵消了字节增加和速度提高所带来的效益。
  中文效率的根本问题不是出在计算机方面,而是出在汉字方式本身。因而,不管用不用计算机,也不管计算机技术怎么发展,中文的低效率问题依然存在。再说,计算机技术发展,所有的语言文字都得益,相比之下,原来高效率的文字方式的效率仍然是高效率的,汉字方式仍然处于不利地位。

五、 信息熵:鉴别微软公司中文产品的有力工具
  信息学的基本原理和方法说明,保持文字字符的信息熵和多余度之间的比例关系合理与稳定,是非常必要的。可是,这十几年,中文软件的发展基本倾向是不断地为输入方法加码和编制新码,只考虑市场利益,不考虑信息科学技术的基本要求。微软公司搞的“智能”等输入方法是一个突出代表。例如,该公司说,使用它的“智能”输入方法,只要打出一个或数个汉字的编码,就能显示出整个词组或句子。微软公司把这样的方法称为“世界级”的高科技。其实,这种方法不外乎两条:
  (一)用数理统计方法列出字符组合的可能,把这些可能储存起来,根据用户打出的特定字符来寻找和显示这些可能。
  (二)用数理统计方法归纳字词之间的联系的可能和频率,建立这些可能和频率的索引,储存起来,根据用户击键的先后次序,寻找索引,再根据索引调度和显示字符。
  这些方法,可以用“对号入座”来比喻。早在八十年代初期,许多英文软件厂商就已经使用这些方法了,厂商可以预存各种可能,用户也能根据自己的需要来规定如何“对号入座”调动字符。作者本人撰写这篇稿件所使用的中文软件,是八十年代初期的美国/加拿大产品,也早就使用“对号入座”的方法了,而且允许用户自己规定如何“对号入座”。然而,那个时候,各个厂商从来没有把这些方法称作“智能”技术。基本考虑是:(一)按照信息科学技术的基本原理来保证信息熵和多余度之间的合理比例关系,保证多余度基本稳定,从而能保证有长期稳定的和规模合理的数据管理标准。(二)严格说来,“智能”技术是思维和设备能力的技术,借以完成通常和人类智力有关的一些功能,例如推理、学习和自我改进(见IBM 《数据处理、通讯和办公系统辞典》)。“对号入座”是重复预存规定的推理和动作,它的“学习”和“改进”基本上是索引等预存的扩展,并不产生新的能力。
  在英文市场,微软公司没有把“对号入座”宣扬成“智能”方法,否则,就会引起大家的笑话。然而,微软公司却在中国把“对号入座”的方法称作“智能”高科技来到处兜售,还用了许多数学方法作证明,例如,用统计方法和树理论证明“智能”输入法,用模糊数学证明词句联系和检测,等等。对没有学过有关数学方法和信息熵理论的人来说,那些新鲜词汇的确挺吓唬人,以为微软公司的方法可能真的是“世界级”的高科技。然而,如果了解了有关原理和方法,就能看出,微软公司的作法,不过是把早已有的“对号入座”方法冠以新的时髦词汇,以此来提高销售量。如果“对号入座”真的是“世界级”的高科技的话,那么,该公司为什么不在英文市场宣扬和兜售呢?微软公司的“世界级”高科技中文软件到底如何?事实最能说服人。让我们来看一个例子。下面的段落是从微软公司的中文新闻报告(1999年3月4日)中直接摘录的:
  “中文处理能力有重大突破
Office 2000在中文处理方面也有重大突破。Office 2000中文版集成了最新的微软拼音输入法2.0并首次引进中文的语法校对和拼 写检查。使得用户可以使用鼠标而无须其他设备来实现中文手写输入;并成功实现了基于Unicode的繁体中文简体中文之间的相互 转换,为全球范围炎黄子孙进行中文交流提供了更有力的工具;汉语拼音的注音功能则为中文基础教育提供了方便。”
   受过基础语文教育的人都能看到,这段话有不少基本常识的错误。例如:第二句里的“集成了”应该是“汇集了”。“使得用户可以使用使用……”一句当中,“使得”用词不当,“使用”一词重复,而且,这个句子没有主语,标点用了分号,使后面的并列句全都成了没有主语的错句。同时,有的并列句在分号后面用“并”,后来的又不用连接词了。在“并成功实现了……相互转换”一句中,“繁体中文”与“简体中文”中间少了“和”字。“为全球范围炎黄子孙进行中文交流提供了更有力的工具”一句当中,“进行中文交流”,应该是“使用中文交流”;“提供了更有力的工具”的“更”字,事先没有列出比较对象,是多余的。这些都不符合中文的基本常识和规范。从写作方面来看,这段话写得很别扭,不通顺,很难上口朗读。此外,所谓“汉语拼音的注音功能”是中国科学家早在四十多年前就已经完成、并且在一九五八年就被确定为中国国家标准的一部分,根本不是微软公司的发明和“突破”,而是微软公司在盗版侵权,把国家标准归为自己所有。
   这么短短的一段新闻报导,错误如此之多,微软公司的所谓“中文处理能力的重大突破”到底是什么?它用那些数理统计、树理论和模糊数学等方法证明的高科技,搞出来的结果就是这个样子?这就是它的“世界级”的“智能”技术水平吗?
  从信息论的角度看,微软公司中文软件系列的“智能”方法造成了不少误导:它把人们的注意力转移到中文的多余度方面,忽略包括信息熵在内的信息科学技术的整体;它破坏了中文多余度的合理比例和相对稳定,违背了信息科学的基本原理;它的方法违反了国家颁布的语言文字的基本规范,增加了数据管理的消耗和成本,加大了中文语言文字学习和使用之间的差距,对中国的文化教育等公共事业造成了巨大损失。不管微软公司用多少时髦词汇来描述它的中文软件产品,微软“定量炸弹”对中文信息产业的威胁依然存在。

六、 文艺复兴:中文信息产业基础建设的战略条件
  从以上阐述可以看出,汉字信息量大,是中文信息管理和传递成本高、消耗大和效率低的基本原因。汉字为中国文明的延续发展发挥了巨大的历史作用。今天,汉字方式是阻碍中文信息科学技术发展的头号困难因素。中国可以在信息工业的机械设计和制作方面赶上世界先进水平,然而,如果不能摆正和改善中文的信息熵和多余度之间的关系,那么,中国的信息产业的整体就总是低效率的,就总得跟着别人后面走,难免挨打。一些美国人担心中国发展计算机和导弹技术会造成“中国威胁”,那的确是夸张了。即便把美国所有的计算机技术和导弹技术都交给中国,只要中国还是按照汉字方式来操作,那么,在计算机和导弹技术方面,中国就总是处于不利地位,总是赶不上美国。中国火箭导弹技术专家钱学森等人早就说过:如何提高中文效率是关系到国家安全的战略大事。
  许多从事中文信息熵研究的科学家们说:中国失去了整整一个打字机时代(工业革命),对中国的综合国力建设带来了不利条件。在计算机信息时代,汉字方式和现代科学技术矛盾更加深化了,其中最大的问题是如何利用信息熵的原理和方法来优化中文数据的管理和传递,其中包括文字方式和书写工具(例如计算机)的最优结合。这是中国科学家近30年之久的中文信息论研究的经验,其中有些科研成果受到了国际科学界的承认和高度重视。面对日益强盛的信息时代的挑战,中国科学家是有充分准备的。如果中国能按照原来准备好了的方向发展,那么,中国的信息产业(包括软件产业)就会避免许多弯路,微软公司对中国软件市场的误导作用和它的“定量炸弹”的威胁也不会那么严重。
  然而,这些年来,中国有些报刊杂志望文生义,以为“汉字信息量大”是好事情,把它作为鼓吹“汉字文化”和“汉字优越”论的依据,甚至把这些违背科学技术基本原理的东西贴上爱国主义的标签。这种作法极大地误导了人们对信息科学技术的理解。微软公司最关心的是中国市场的利润,而不是中文信息科学技术的前途。“汉字优越”论鼓动人们不要去过问中文信息产业发展的基础科学技术问题,对微软公司来说,是正中下怀,为微软公司渗透和控制中文软件市场提供了重要的文化条件和舆论条件。
  信息科学技术跟语言文字息息相关,它的发展对许多国家的传统文化提出了挑战,包括对美国一类信息工业大国的挑战。中国的历史悠长,文字方式独特,自然就受到最严峻的挑战。面对科学技术的挑战,就要用科学技术的发展来迎战,用极端民族主义的作法回应挑战,最后总是失败,传统文化最后也还是保不住。
  国家主席江泽民多次提出,中国要成为现代化的富强国家,就要有文艺复兴。这个号召有非常重大的意义,不但指明了中国民族传统文化延续和发展的唯一出路,而且也为中文信息产业的基础建设提出了方向性的战略课题。文艺复兴不是文化复古,而是在本国历史的基础上吸收各种文化的长处,自我革新,向前发展。文艺复兴的一个基本内容是文字方式必须符合时代发展的需要。“汉字文化”和“汉字优越”论所提倡的不是中国的文艺复兴,而是在鼓吹文化复古;不是有利于科教兴国,而是在加重中国信息科学技术发展所面临的困难,特别是加重了政治和文化方面的困难。没有对汉字方式和传统文化的正确认识,就很难搞好中文信息产业的基础建设。
  中国政府可以通过法律、标准和专利等手段来为中文软件和中文信息产业的发展提供环境保护,民间可以用罢购、产品替换和文学作品等方式抵制外来货。然而,“发展才是硬道理。”中文软件和中文信息产业到底能不能在日益全球化的竞争中幸存,最后还得看自己的基础建设搞得怎么样。就目前和可见将来的状况来说,中文信息产业基础建设的中心课题,就是要利用信息熵的基本原理和方法来提高中文的效率,铲除微软公司“定量炸弹”的潜在威胁。为此,把握住文艺复兴的战略方向,防止文化复古潮流的干扰,是搞好中文信息产业基础建设所必需的和非常重要的文化条件。
【基本参考资料】
(1)THE MATHEMATICAL THEORY OF COMMUNICATIONS,by C.SHANNON,1949。
(2)D
 樓主| 發表於 2005-12-11 21:58:02 | 顯示全部樓層
该文论述的汉字信息化处理方面的问题令人触目惊心,请精通汉字信息化处理的戴石麟老师、张时钊老师、汤光大先生等诸位大家对文中的观点特别是有关“定量炸弹”的描述谈谈自己的见解。我本人因这方面知识欠缺,不能完全地理解作者所指出的攸关中国信息化事业成败的这种心腹大患的极其巨大的危害性的根源所在。

[ 本帖最后由 乘风破浪 于 2006-02-10 14:44:48 编辑 ]
發表於 2006-1-18 12:35:24 | 顯示全部樓層
文中将汉字建立于字的基础上,这本身与拉丁文不可比。笔划与字母在结构上是同级,使用笔划计算信息商方为正确选择。如此,此此文便大错特错了:理论基础不成立,引发的各项论述均为错误。经过张时钊老师的计算,汉字的信息商不会比拉丁文高。以下是张老师关于信息商的论述:http://www.chancezoo.net/hz/hzh.htm。

关于汉字熵(信息量)

陕西省气象局   张时钊  2003.10.20

一、引子

网上有一篇来自纽约的米阿仑写的文章,题目叫《从信息熵角度看中文软件和中文信息业的发展》(已转贴在我的论坛上)。这是一篇难得的好文章,很值得一读。他认为:“微软公司在设计制作中文软件的时候,忽略了信息科学技术的基础课题:信息熵。” 因而埋下了“定量炸弹”。“这颗炸弹涉及的不是两个字节(指千年虫Y2K——引用者注),而是整个系统的基础。把它称‘定量’,是因为没有达到一定信息产业的产品数量和技术要求的程度,就很难看到这颗炸弹的潜在威胁会造成多大损失。这颗炸弹可能很快起爆,也可能要等一段时间,全看中文信息产业发展如何。一旦起爆,那就不是两个字节的问题,而是整个系统以及这个系统下的全部数据和操作的问题,其威胁比Y2K 要大得多。”“中文信息产业相当大的一部分很可能有一天会毁于微软公司的‘定量炸弹’。”

我确实不理解这个“定量炸弹”的来龙去脉。从作者后来说的以下一段话,或可理解它的实质。他说:“中文数据的文字方式决定了标准的多重性和规模过大,而且,只要汉字还再增加,它的字符集就是不稳定的。不管一个字符用多少字节,也不管计算机的储存容量有多大,也不管各种系统的兼容有多么全面,这样的字符集做数据储存和检索还可以,做全面的数据管理就总是有严重问题。”作者反复说的中文“文字方式”,应该就是我说的“汉字植根于电脑”的字库加编码方式。在这个方式下,字库或字符集大而不稳定,是全部困难的所在。显然,字符集一改变,一切已数字化的资料就作废了。汉字不仅太多,而且必然还要产生新汉字,字符集永远不可能稳定。相反的,英文只有26个字母,十分稳定。如果也对英文字(词)编码,问题可能更严重。如果汉字按我的无字库方式,采用笔画组字技术,一切问题都解决了。汉字笔画正好对应西文字母,只要制定出汉字笔画标准,中文也同样稳定。据研究,可能比英文还要稳定,你看,英语学生完全看不懂他们的古文,而中国学生看中文古文就较容易。

作者在文中介绍了熵(信息量)的概念。他说:“汉字的信息量最大,因而,在信息管理和传递的时候,中文处于最不利的地位。”“一般说来,某种文字的字符信息熵越大,原始数据输入的工作量有可能变得越小,而整体工作效率就越低。”苏培成教授的“现代汉字学纲要”中也有类似的论述。米阿仑虽然没有明确指出,所谓的“定量炸弹”就是因为汉字信息量大,但我觉得文章的主题实际上就是这句话。文中虽没有很多数学式子,但因涉及较新的信息论数学,而我们搞文的数学根基不大好,准确理解可能还是有困难。由于问题的重要,有必要再深入浅出地讨论汉字的信息熵这个概念,明白为什么汉字的信息量大,为什么信息量大了反而不好,应如何解决“定量炸弹”这个危险问题。我自己的数学,从初中起就只靠自修学的,现在年纪大了,看到数学式子也头痛,对数学式子的理解可能不正确。下面叙述的只是我个人的理解方法,如果不准确,请大家批评指正。

二、汉字熵

熵,是物理名字,在信息论里则叫信息量。从控制论的角度来看,应叫不确定性。当我们不知道某事物具体状态,却知道它有几种可能性时,显然,可能性种类愈多,不确定性愈大。不确定性愈大的事物,我们最后确定了、知道了,这就是说我们从中得到了愈多的信息,也就是信息量大。所以,熵、不确定性、信息量,这三者是同一个数值。最简单的是只有两种可能性,非此即彼,我们就以这种事物的信息量为单位,叫1比特(bit)。4种可能性,用二分法,分为2组,我们要非此即彼地确定2次,才能确定其状态,所以含有2比特信息量。如果可能性数目有2的n次方(N=2^n),那就是n比特,即信息量等于可能性数目N的‘以2为底的对数’:H=㏒2(N)=㏒(N)/㏒(2)。后一个等号说明,以2为底的对数㏒2可用普通对数㏒(以10为底)来计算,即用N的普通对数除2的普通对数。N=3种可能性时,信息量H=㏒(3)/㏒(2)=1.585。只要有函数型计算器,我们就可以进行以下简单实例的验算。

我们现在不是讨论事物本身的信息量,而是讨论描述事物的文字符号包含的信息量。先讨论比较简单的数字符号。二进制数只有2个符号:0和1。一位二进制数有2种可能性,其信息量是1比特。n位二进制数可记N=2^n个不相等的数,含有n比特信息,所以每位数字的信息量还是1。十进制数字有10个,每位数字的信息量是㏒(10)/ ㏒(2)=1/0.301=3.32。不难验证所有十进制数,每位数字的信息量都是3.32,例如3位数共1000个,信息量是㏒(1000)/ ㏒(2)=3*3.32。而十六进制的每位数字的信息量是4。

事情好像很简单,其实不然。试考虑还没有发明数字的远古人,他用刻画来记数,用刻n画的方法记数目n。10以内的数平均每个数要刻(1+10)/2=5.5画,每画的平均信息量是3.32/5.5=0.604,而100以内的数平均每个数(1+100)/2=50.5画,每画的平均信息量只有6.64/50. 5=0.132。因为古人刻的每一画是没有次序或位置的区别的,所以每一画的信息量变化很大,数值则很小。次序或位置非常重要,罗马字和我国古代的数码,也是短画,但要讲究位置组合,每画所含的信息量就大大提高了。注意,我们以后讨论的文字信号,都是有次序的。

这样,文字信号的信息量H是信号个数n的以2为底的对数: H=㏒(n)/ ㏒(2)。英文有 26个字母,每个字母的信息量H=㏒(26)/ ㏒(2)=4.700。汉字个数不定,算1000个时等于3*3.32=9.96,算作一万、十万时则分别为13.28、16.60。我们能随意增加大量一辈子也用不到的汉字,来无限地增加每个汉字的信息量?这当然不合理。原来信息量不能无条件地按符号的个数来计算,只有各符号的可能性一样,都等于1/n时才行。数字符号就满足这样的条件。事实上信息量应按符号的可能性(数学上叫概率大小)来计算,它是概率的负对数。对于二进制数,每个符号的概率都等于1/2,按负对数计算:-㏒(1/n)=-(㏒(1)- ㏒(n))=-(0-㏒(n))=㏒(n)。这就是我们前面使用的公式的来源。如果符号i的概率pi不等于1/n,则Hi=-㏒(pi)。因为各个符号的概率pi不相等,对于总体来说,平均信息量就是它们的加权平均H=-∑pi㏒(pi),这里累加符号∑表示对所有 i 进行累计。(以上式子除以㏒(2),就可化为以比特为单位了)。

定义信息量为概率的负对数,是很合理的。试考虑一个两种可能性的事物,仅当可能性相等时,不确定性最大,最后我们知道了某一可能性确实发生了,也得到最大的信息量。如果其中某一个可能性很大(另一个必然很小),不确定性就很小。如果可能性大到1,也就是必然要发生的,因为1的对数为0,我们从知道它的发生这件事得到的信息也为0。

按这个公式计算汉字的信息量时,汉字的平均信息量在字数达到1000时很快增至9.00,字数达到5000时就达到9.65,以后几乎不再增加。(参见后面的表和图)。学者冯志伟有一个“汉字容量极限定律”,认为字数达到12366后,信息量不再增加。以下是各种语言的字母的信息量:

      法文          3.98比特

      意大利文      4.00比特

      西班牙文      4.01比特

      英文          4.03比特

      德文          4.10比特

      罗马尼亚文    4.12比特

      俄文          4.35比特

      中文          9.65比特

我在“论汉字笔画”一文中,使用自己的小样本统计数据,计算得英文的信息量是4.16。这个数值稍大些,是因为我还加了一个特殊字符“空格”,㏒(27)=4.755就比㏒(26)大0.055。可见平均信息量是很稳定的。

三、多余度

由上可知,有n个符号的文字,每个字符最大的信息量(最大熵)H0=㏒(n)(即-㏒(1/n)),而有不相等概率时,其平均信息量(平均熵)H=-∑pi㏒(pi)总小于最大信息量H0。例如英文的最大信息量等于4.7,就要用5个二进制数码来编码和传输。但它的平均信息量近于4.03,表示实际上可用比4个多一点点的二进制位就可以了。方法是用不等长的编码,概率小的用长码(多于4位),概率大的用短码(少于4位)。信息量的计算就可指导我们编码设计,减小码长,提高通信效率。

除了文字符号的一定的概率分布,包含了一部分信息外,文字的上下文关系,包含了更多的信息,使一篇文字的实际信息量更小(小于各个文字的信息量之和)。因为已知一定的前文,且已知前文愈长,其后的文字符号分布将更确定。计算这样的条件信息量,当然很复杂而困难。这样达到的最小的信息量,称为极限信息量(极限熵)HL 。我们可以进一步研制使传输更快的编码,即不是对个别文字符号,而是对文字串进行编码,就可使平均码长减小,逼近极限熵。这就像我们直接对中文词或句子编码可以提高输入速度一样,因为许多汉字组合是不可能出现的。

据研究,英文和中文的极限熵为(见苏培成“现代汉字学纲要”193页):

       英文:    0.93~1.56比特(原书是0.28~0.47,要除㏒(2)化为比特)

       中文:    3.45~5.78比特(原书是1.04~1.74,要除㏒(2)化为比特)

              一个汉字相当于3.7个英文字母。

极限熵HL 比最大熵H0 小得多,它们之间的差很大,说明这一部分熵是多余的,被浪费了。信息论研究这样的多余度:

R=(1-HL/H0)
發表於 2006-1-25 11:21:23 | 顯示全部樓層
回复1楼 乘风破浪
令汉字改革者感到悲哀的,汉字在电脑和网上致命的缺点,被那些爱国主义者和汉字的专家学者说成是汉字盖世无双的优点。而且说这些话的人,都是中国人的精华。中国人的精华尚且如此,中国信息现代化的命运将在何方。
我真不知道,科盲的帽子,该带在谁的头上。在铁的事实面前,硬说汉字的存储空间和英文是一样的。(上面的汉字存储空间的举例都不是字模的的存储)

[ 本帖最后由 汤光大 于 2006-01-25 11:33:08 编辑 ]
發表於 2006-1-31 13:05:33 | 顯示全部樓層
汉字进入电脑的基础是笔划,不是整个汉字。现在是错误的决策。
其实论笔划,汉字在信息熵上不具有优势。存储空间也不具有优势。如果要发挥汉字的优势,就要发挥汉字的思维功能。这样即使占用的空间较大,也是值得的。正如便宜无好货,好货不便宜。
發表於 2006-2-8 10:16:30 | 顯示全部樓層
引用
原文由 汤光大 发表于 2006-1-25 11:21:23 :
回复1楼 乘风破浪
令汉字改革者感到悲哀的,汉字在电脑和网上致命的缺点,被那些爱国主义者和汉字的专家学者说成是汉字盖世无双的优点。而且说这些话的人,都是中国人的精华。中国人的精华尚且如此,中国信息现代化的命运将在何方。
我真不知道,科盲的帽子,该带在谁的头上。在铁的事实面前,硬说汉字的存储空间和英文是一样的。(上面的汉字存储空间的举例都不是字模的的存储)

[ 本帖最后由 汤光大 于 2006-01-25 11:33:08 编辑 ]


你是科盲,当之无愧。
您需要登錄後才可以回帖 登錄 | 入住家園

本版積分規則

手機版|小黑屋|吳語書院

GMT+8, 2026-9-4 18:08 , Processed in 0.027994 second(s), 16 queries .

Powered by Discuz! X3.5

© 2001-2026 Discuz! Team.

快速回復 返回頂部 返回列表