找回密碼
 入住家園
查看: 1592|回復: 2

【讨论】构建优质的漢字内码

[複製鏈接]
發表於 2006-7-20 13:50:13 | 顯示全部樓層 |閱讀模式
http://www.gmw.cn/03pindao/lunwen/show.asp?id=9720
摘要:
    本文由信息内容开篇导出漢字根植计算机的方式是字根编码。并从文化的继承、存储传输的特點、技术的可实现性、现实的需求论证了可行性。最後指明此方式根植计算机会使得漢字称为智能型思维文字。由于按照此理论必然對漢字進行改造,因此本文對某些简体字作了恢复繁体的处理,所以呈现的是繁简混合应用,望理解。  

关键词:字根、无窮漢字、漢字思维、完全码、明细码、精简码、内码、智能型思维文字  

  中文信息化:是用计算机對中文(包括语言和文字)進行转换、传输、存贮、分析等加工的科学。根據定义不難看出中文信息化的根基就是漢字根植于计算机,否则无从谈起信息化。现今的漢字根植于电脑的方式是一字一码,解決了当务之急。但出现了新问题:缺字。从而不得不做大字库,结果问题不僅没有得到根治,而且出现了错字、重字等,字库也不稳定。這预示着走大字库是错误的。那么漢字该如何根植计算机呢?
  在定义中已经提到转换、传输、存贮、分析等技术方面的信息化内容,那么其他方面呢?
  古典文化的信息化。中国古典文化有书法、诗词歌赋等,构成了中国文化的重要组成部份。如何的继承這些文化,使其在计算机中得以延伸理所当然的成为中文信息化的内容。此外甲骨文、隶书等各种文字的存储、古代思想的吸取、古代科技的吸取等都是中文信息化的任务。做为中文信息化,保持文化的连续性是其任务之一。
  漢字做为表意文字,经過几千年的磨练,具有了其他文字不可比拟的思维功能。如何充分發挥漢字的思维功能,使其在计算机中游刃有余,正是中文信息化的目標:漢字思维。唯此方能体现计算机的作用:摆脱繁重的脑力勞动。
  既然中文信息化的目標是漢字思维,那么就从信息化的目標入手,分析出漢字根植电脑的方式。众所周知,英文是词本位,中文是字本位。所以漢字思维是基于字的思维。那么字是不是思维的最小单位呢?答曰非也。字根是思维的最小单位。我们熟知的“艹、扌、灬”均代表一定意义,而再小一级的笔划则不代表意义,所以说字根是思维的最小单位。书法是一笔一画的写出來的,考究的也是笔划及其搭配,可以说书法的最小单位是笔划。既然基于书法的最小单位笔划與基于思维的最小单位字根不同,那么应该选取哪一个做为漢字根植计算机的基本单位呢?显然思维重于书法,必然选取字根。其优點如下:
  利用字根编码由于把精力放在了字根是否正確和字根组字上,能充分保障漢字的正確性。由于字根组字能一目瞭然的得出漢字组成,防止了重字。另外可用字根无限组合,自然漢字是无限的,同时可自造漢字。字根根植计算机不僅克服了现今根植方式的缺點,而且还提供更强的功能。
  在存储上,简体漢字9~11笔划的最多。若按平均10划计算,每划占用1个字节,那么平均每个漢字占用的空间不少于10个字节。使用字根存储,简体漢字每个漢字的字根约为2~3个,若按3个计算,每个字根占用2个字节,则每个漢字不少于6个字节。显然短于笔划所占用的空间,并且在结构上比笔划清晰的多,因此附加信息也要少。而兩者均能实现无限漢字和自造漢字。但以下所带來的功能確实其他根植方式不能给予的:性能與码长之比高。
  漢字特有的表意性,表现在极强的组词能力和字的可猜性。漢字的可猜测性是从字根开始的,往往與字意结合在一起。這是漢字思维的基础。只有字根方能做到。此影响到继承古代的思想、计算机替代人类思考等许多功能。而這些才是真正需要的。
  保障文化的连续性不僅要保障文字的连续性,还要保障文法的连续性。首先文字的连续性。漢字由甲骨文到现今字体,已经变的是大相径庭了。要想保障其连续性似乎不可能。不過仔细研究就不難發现,笔划虽然变的面目全非,但字根则稳定的多。可以说用字根根植计算机保障了文字的连续性。其次是文法的连续性。中文有自己的特殊文法。若按当前一字一码的走向词化,势必丢失這些瑰宝。利用漢字特有的表意性和中文文法的约束,能保障诗词歌赋等的连续性。
  以上论述了字根根植计算机的优點,由此成为根植计算机的必然选擇。那么有哪些缺點需要克服呢?书法最小单位是笔划,显然字根是无法实现的。现今的漢字内码是一字一码,虽然暴漏出许多缺點,但是码长精简、字的个数容易點数却是无庸置疑的。码长短意味着传输、查询速度快,這是字根编码的第二缺點。那么有无方法调和呢?答曰有。可将编码分为:明细码、完全码、精简码。用字根编码称为完全码;将字根用笔划编码,扩展後的完全码称为明细码;将现今的漢字内码與完全码對应起來,做为完全码的索引序号,称为精简码。如此一來书法漢字可用完全码確定漢字,用明细码確定字形,达到书法的平民化;利用精简码取得大家的约定,既使得传输速度加快,更重要的是保障了现今信息化成果的连续性,這點不可谓不重要。
  漢字内码用字根编码在现实中是可行的,也是需要的,那么技术上是否可行呢?漢字是非线性的,计算机是线性的。由非线性到线性势必要记录非线性信息:漢字结构。漢字结构如下:
  单独一体。例如:山、石、田、土、人、口、手、羊、马
  并列:左右、左中右、上下、上中下。例如:跟(左右)、意(上下)
  包围:
  兩连邊围:在左上包围、在左下包围、在右上包围、在右下包围
  三连邊围:在上包围、在左包围、在下包围、在右包围
  對面围:在左右围、在上下围。例如:辩、辨、衮
  全包围
  共16种基本结构,由此可构建更复杂的结构。
  這里所说的字根不是输入法的字根,而是代表一定意义的字根,同时附带一些声音记录。如此字根是非常繁多的,甚至组合後的字也可成为字根。對于不能再解析的字根称为基本字根,基本字根是有一定数量的。完全码就是漢字结构中添入字根组成。因此,即使字根、结构一处不同则意味着漢字的不同。同樣,漢字的不同,必然带來结构或字根某一处的不同。所以完全码完全可以做到一字一码。解決了完全码對漢字编码的影响,还有完全码對字形的影响。由于完全码记录了字根组成漢字的信息,并不记录笔划形状的信息,所以完全码不记录字形信息。與英文字母内码相同,不记录字形信息。但通過此信息可以找出相应的字形。
  既然技术上也可实现,那么就是眼前的应用问题。排序檢索是基本功能之一。英文檢索:字母、音標。中文檢索:笔划、字根(当前部首为字根的一部份)、拼音。所谓排序就是對组成文字基本要素的排序,计算机本身并不直接存储文字,所以不是對文字的排序。英文存储的是字母,自然就是按照字母排序。中文存储的是笔划、字根,自然按照這兩者排序:笔划在前、字根随之,因为笔划较少、字根众多。
  完全码存在性的问题解決了,那么在实際中有哪些应用呢?如:巴士、中巴的“巴”,显然表音不表意,不能表示出是车或與车有关。若左侧加“车”字旁,即使不会读,也会想到车。完全凭借其灵活性,完全可以造出這个漢字而不影响其传播的其他各种处理。可以说完全码起到了定本放形的作用:像风箏可以自由飞翔,但永远不会脱离线。
  综上所述,字根根植计算机不僅是社会的需要,技术上完全可以实现,同时也适应了现今社会的需字。因此用字根根植计算机的完全码,并附明细码和精简码是完全可能的,最终使得漢字在电脑中成为最优秀的文字:智慧型思维文字。

[ 本帖最后由 foxsql 于 2006-07-21 16:41:00 编辑 ]
發表於 2006-8-6 07:22:31 | 顯示全部樓層
论坛中有类似的思路的人不少。
通常是用一个带多个参数(结构参数,字根(或叫部件)参数))的多重嵌套的函数来表达某一个字的。通常叫‘无字库内码’。——其实是无大字库,作为字根(或叫部件)的小字库还是必不可少的。而且,为了显示出实际的字型,还需要定义各种同结构参数对应的用于字根组合(缩放,平移,拉长压缩变形等几何变换)的函数。
这种方法最大的困难在于:
1)字根(部件)总数太多(超过400~1000),且难以精确确定。
2)字根组合函数由于要设计字型美观问题而设计复杂。
3)最后的代表汉字的函数表达式如作为内码使用,过于冗长,效率低不经济;如按楼主想法最后再代回到现用的大字库编码,则由于大字库的所有缺点一样不少照样存在,故其意义不大。

[ 本帖最后由 gzgznone 于 2006-08-06 07:24:00 编辑 ]
 樓主| 發表於 2006-8-7 08:46:05 | 顯示全部樓層
1、请楼上编写兩年程序,方知函数的複雜程度以及运算速度
2、搜索下电腦理论方面的知识,尤其是编码方面的。不要陷入漢字编码。便知函数表达式是否需传输,英文字母何时传输過函数?
3、英文单词的冗余是(4.6-3)÷3=53%,也未见美国人更正啊?可见此时的效率低下不是问题,也不增加太多成本。反观社会成本更大,降低社会成本,启發人的能动作用才是上策。中文的静态冗余是200%,动态冗余53%,与英文相同。可见,基於小字库的漢字内码不存在過於冗余,效率低下不经济的问题。
4、你再仔细看有关小字库的理论再做言论
最後感谢你探讨
您需要登錄後才可以回帖 登錄 | 入住家園

本版積分規則

手機版|小黑屋|吳語書院

GMT+8, 2026-9-4 19:31 , Processed in 0.028223 second(s), 16 queries .

Powered by Discuz! X3.5

© 2001-2026 Discuz! Team.

快速回復 返回頂部 返回列表