找回密碼
 入住家園
查看: 1853|回復: 2

【观点】组字

[複製鏈接]
發表於 2007-6-2 14:32:10 | 顯示全部樓層 |閱讀模式
漢字發展规律
文字的载体与书写工具决定了字形的发展。最原始的文字是用尖锐物(如刀)刻在硬物(如龟壳)上,这是甲骨文;随后书写工具……毛笔繁盛起来,出现了篆体;纸张的出现造成了汉字的隶変。直至今日的汉字依然是隶変的结果。现今,载体发展到了磁介质,书写工具也多样化,汉字也走到了一个进化的阶段。确立了汉字必需进化,就需要考虑如何进化。就此很多前辈及现在的学者们在不停的探索研究。
漢字拼音化
清末民国初之际,中国遭受了前所未有的重创,有识之士深感中国的落后。当时文字开始机械化,中文难于进入计算机,使得国人将汉字作为替罪羊,将汉字改为拼音。至五四运动,汉字拼音化达到一个阶段的顶峰。此时呼喊此口号者皆为具有西方屈折语的语言学知识,同时痛恨民族劣根性,希借此拼音化扫一扫民族劣习之斗士。并有“汉字不灭,中国必亡”的言论。新中国成立后,推行了简化字,制定现行的汉语拼音。汉字最危险的时刻是在八十年代。随着微机网络的应用与普及,信息技术在国家中所占的地位一日重过一日。但汉字的输入成为无法突破的瓶颈,“拼音化”又开始了呐喊。时过不久,就被国人成功的解决了这一难题。时至今日,“汉字拼音化”的问题却未随这些风波的结束而结束,并呈愈演愈烈之势!汉字难学、难写成了汉字拼音化的借口。此文讨论汉字信息化,不做这些问题的讨论。
汉字信息化的必要性及存在的问题
在汉字进入计算机後,汉字不能适应计算机的言论破灭,汉字的优越性得到提升。维护汉字、发展汉字得到发展。因此形成了漢字拼音化、维护汉字两派。本人的观点就是维护汉字、发展汉字。
漢字记录了中国5千年的文化、科技等。割掉漢字等于失去这些成果,勢必使中国从头摸索或跟在西方的屁股後;若進行翻译,其翻译成本又很高。所以立场该为“维护汉字”,将漢字进一步信息化。这才是强国的出路。
漢字信息化已有很久,初步形成了一套体系,有着自己的概念:录入码、內码、形码。录入码是解決如何將漢字录入機械,屬人機交互部份。形码是機械將漢字显示,提供视觉功能,屬人機交互部份。內码是计算機內部处理漢字用的,屬字符集。现在字符集众多,已发展出大字符集。大字符集及其對应大字库所存在的缺陷:㣫字、错字、空间利用率低、字库不穩定等。
此前漢字信息化遗留的问题:
1、大字符集问题外
2、一字一码使得漢字被封闭在固定範围內,无法新造字,遏止了漢字的生命力
这些是当前存在的问题,也是“汉字拼音化”所例举的证据之一。
徹底實现漢字信息化
何为徹底實现漢字信息化:支持无限漢字、支持造字,保障漢字發展。
若徹底實現漢字信息化,必需找出漢字的發展规律,依漢字發展规律進行信息化。
漢字發展规律:载体、书寫工具的改変必影响漢字,所以必對漢字進行必需的改動。既然是改動、不是改革,那么必需理清漢字的發展规律。筆者认为,理清漢字的规律就是找出漢字發展過程中的変與不変:漢字的结構、漢字结構演算、漢字的字根未変;漢字的筆划、字根形状發生了重大改変,引起了视觉上的重大改変。這裏的不変不是绝對的,只是異常的穩定,畢竟漢字很长時间在无理论、非意識的情況下發展的。
此处字根與录入法的字根概念不同:字根即字之根本,在漢字演化過程中,保持功能不変的筆划组合。功能即表意或表音。字根是依漢字發展進行纵向统计。
部件:漢字常用筆划组合。部件是依漢字间的比较進行橫向统计。录入法的字根實质是一種拆分出來的部件,非字根。
字根與部件比较,字根具有一定的功能,也正是如此,字根才成为字之根本。由于字根是纵向统计,所以基于字根的漢字信息化也就容納了更多的漢字字体:如篆体、隶书等。不同字体间筆划是不同的,且组合情況変化甚大,所以部件只能根據一種字体進行统计,具有很大的局限性。但部件具有数量少的优点。
英文由52(大小寫不同)个字母组成,可排出无限个单词。字母、排列方式是不変的,字母的书寫是変的。英文的實質是利用其不変屬性構建其內码的。
找出漢字的変與不変,就意味着可用漢字的不変屬性構建漢字內码:一種全新的字符集,利用漢字的不変组合出无窮漢字……组字法。同英文,漢字的不変屬性也是有限的,其组出的漢字是无限的。與现今漢字內码比较,组字法的漢字內码是変长的,现今漢字內码是定长的……单字(一个字是兩個字節),大字符集是雙字。
徹底實现漢字信息化不僅需達到其预定目標,且必需解決遗留问题、继承已取得信息化成果。依组字法,僅需斠驗字根寫法是否正確即可防止筆划级错字的發生;同時组字法的本身就具有防止㣫字的功能;更保障了漢字的生命。组字法在達到预定目標及解決现有難题上,有着最後兩个困難:空间利用率未提高而是降低、如何继承已取得的信息化成果。
构建优质的汉字字符集
這兩个问题的关键點是字符集上:组字法是利用字符集编码组出漢字;现在的方法是直接對漢字進行编码。使组字法包容现行的字符集即可同時解決兩个難題。所以我提出漢字的精简码與完全码兩个概念。精简码,即现行的漢字內码,漢字在文档內的存储一律用精简码。完全码,即利用组字字符集组出的汉字内码。可创建精简码与完全码对应表,利用此表方便找到双方对应的内码。
包容了现行字符,文档空间利用率得到保持,现有信息化成果也得到继承。就是说组字法在期望上是可行的,那么在技术上呢?首先需知汉字信息化方面:录入、内部处理、显示。显示上有两个层面:字符集、字库。字符集是用于计算机内部处理文字,字库用于显示文字。汉字是变化多端的,组出的字形不一定能保障方方面面的需求,所以有包容整字字形的必要。因此,字库可选择整字字形或字根字形。
至此,大家肯定有疑问,笔划呢?上面的组字法字符集内未包含笔划。笔划是书写的最小单位,但不是显示的最小单位。整字字形显示的最小单位就是整字,字根字形显示的最小单位就是字根。所以笔划可不纳入字符集。中国自古是书法大国,这块瑰宝是基于文字的,作为炎黄子孙,我们有责任延续这块瑰宝。所以,组字法内也就纳入了笔划。至此,组字法字符集有了三个层面:整字(继承已取得的信息化成果)、字根、笔划。与字符集对应,字库也就有整字字形、字根字形、笔划字形。下面就描述这三者之间的关系。

如上图,显示汉字过程是:依据精简码在字库内取得相应字形,然后进行显示;也可(或无整字时)找到与精简码对应的完全码,取得字库内的字根字形进行显示;字根也可由笔划组成,进行笔划级的显示。可见汉字内码与笔划无缘,原因还是前面提到的,笔划是変的,而汉字内码是稳定的。完全码还有其他好处。繁简转换、异体字等问题。很多情况下,仅仅是字根字形不同,无本质差别。利用完全码可以很方便的识别这些字是否为同一汉字或进行繁简转换。此处增加了笔划级的显示,有两点好处:延续书法艺术、减小字库体积。减小字库体积意味着增加计算量,这个如何处理属于技术实现,由技术人员衡量了。
构建完全码
上面是显示汉字,那么处理汉字呢?首先是如何用字符集构建汉字内码,其次是如何用。英文是线性的,逐个排列即可,汉字是二维的,必需将二维转化为一维。前面提到了汉字的三个不変的属性:漢字的结構、漢字结構演算、漢字的字根。汉字就是通过这三个属性确立其二维结构的,只需用这三个属性描述汉字即可。汉字的结构就是确立什么字根放在哪个位置,这个是大家比较熟悉的,如独体、左右、上下、等,如下图,共16种情况。

漢字结構演算,大家可能比较陌生。大家想想,“冇”这个字如何组出?第一直觉就是独体字,但此字的来源确实是“有”去掉里面的“二”,这就是漢字结構演算。漢字结構演算有三种:拼、叠、挖。最常用的就是拼,无需举例;“冇”是“有”挖去“二”生成的字,古代的琴谱用字就属于此演算,叫做缺笔字;“少”是“小”叠上“丿”。
确立了汉字三个不变属性,那么就需要将这三个属性组合了。当然方法很多,在此仅举一例。

这个字是陕西小吃中的一个字,读音为biàng。右边是对该字的分解。这个树与计算机算法中的树完全相同,这样对完全码的处理就转化成了对树的处理,用相关的计算机算法即可将汉字的二维结构转化为一维结构,得到汉字内码。
在文档方面兼容信息化
解决了内码的构建,还有如何用内码。上述汉字的完全码占用空间17字,常用汉字的完全码也有3字。存入文档,明显使得文档变大,浪费空间。此时需用精简码……现行汉字内码,就是说已有文档无需改变,即可在新的字符集下使用。问题是,如何保存不存在精简码的汉字。这需改变文档格式……在文档尾部增加临时“精简码……完全码对照表”,为此汉字分配临时精简码,文档内即可保存临时码。类比PDF文档,PDF文档就嵌入了字体,不同的是这里嵌入的是对照表。如此做法保全了文档的兼容,但对相应软体提出了新的要求,如复制、粘贴等均需做出处理。相信这不成问题,众多的程序员很快便解决掉。
录入法的信息化
组字法也对录入法构成了影响。已有汉字可手工设计录入法,那么自造汉字呢?对于形码容易解决。如五笔,设定了每个字根的编码,在依据完全码内字根的排列顺序取前三後一的编码,即有了新汉字的编码。现阶段对于音码是个挑战,需要大家制定一个汉字读音规则才能解决。
字根除基字根与演化字根
漢字结構、漢字结構演算前面已经说明,数量不多。余下的就是另一个不变属性:字根。在篆体中不难发现,很多字即使作为字根,形状也不改变,经过进化後,形状发生了很大改变。所以必需考虑此情况,以保障汉字可正常显示。这就出现了基字根与演化字根。此处用演化字根非变形字根,原因就是同一字根有着完全不同的笔划组合,如“手、扌、龵”、“心、忄”、“食、饣”、“水、氵”、“言、讠”。
事实上,很多字就是这种字根的不同表现形式造成了一部份异体字。计算机判断这类异体字是否为同一汉字,将字根换为基字根即可得出是否为同一汉字,这也是防止自造字与已有字重复的一种方法。
字根的变形显示
字根除基字根与演化字根外,还有一个变形问题。一个字根在不同的部位、与不同的字根组合均影响其变形程度,这是为保持汉字的字形美。这就需要对字根做参数设定,这些参数有:外围笔划、纵横轴线、空象限、弹性系数、让位比例等。在汉字中有这么一种现象,就是两个字根组合在一起,若相互接触部份的笔划相同,则合在一起。这就是提供外围笔划的用处,可让计算机自动计算出衔接笔划是否相同、并为一笔,降低空间的拥挤。纵横轴线是针对包围结构提供变形参数的一种方法。
如左图的“辶”。此时用横纵轴线将“辶”分为四部份,即四个象限;设定空象限,对非空象限设定弹性,即象限弹性。如:Ⅰ象限为空象限,横纵弹性为90,让位比例为10。
如左图,设“言”的横纵弹性为90,让位比例为0。依俩字根的弹性系数计算出所占比例。但注意的是,“言”不完全在Ⅰ象限,伸到了其他象限,这就是“辶”的让位比例。所以,根据弹性系数计算出

本帖子中包含更多資源

您需要 登錄 才可以下載或查看,沒有賬號?入住家園

×
 樓主| 發表於 2007-6-2 14:33:10 | 顯示全部樓層
半成品
希望大家指教
發表於 2007-6-18 03:56:23 | 顯示全部樓層
打不开啊。
您需要登錄後才可以回帖 登錄 | 入住家園

本版積分規則

手機版|小黑屋|吳語書院

GMT+8, 2026-9-4 16:33 , Processed in 0.034300 second(s), 17 queries .

Powered by Discuz! X3.5

© 2001-2026 Discuz! Team.

快速回復 返回頂部 返回列表