找回密碼
 入住家園
查看: 724|回復: 0

【分享】有理简化全拼音码从部分复合韵母音节化及一符双音着手

[複製鏈接]
發表於 2008-1-19 04:04:20 | 顯示全部樓層 |閱讀模式
有理系列码音码及音形码简介

  1958年2月制定的《汉语拼音方案》,如采用与英语接近的拉丁化字母、字母基本上不能兼为声母与韵母等,对今天汉字面临的信息时代显示了一种远见。它系统地体现了普通话发音的规则。即韵母由四呼四类及鼻辅音组成,分别用音素字母合成表达,是有利于学习者的掌握与使用的。但是,复合韵母由2~4个音素字母构成,字母的应用效率低。它作为汉字输入的编码,就是全拼输入法。它因此而带上了固有的缺点。一个汉字的字母输入数最多可达6个,加上同音字困扰,影响了输入速度。
  全拼输入因其强大的智能化组词功能,(例如二、三、四键成字、两字词组或三字词组等的输入的灵活性),部分抵消了打单字重码太多的劣势,对于掌握拼音方案的人来说,无记忆负担,在北方话等地区得到了自然的推广。已经成为非专业人员的强势码。双拼法将韵母音节化,简化成一个字母码,完全符合汉字是音节文字的特性。在词组功能一般的上世纪八九十年代,曾流行一时。但现正淡出使用。究其原因,无理的规定造成记忆的一定难度是一个因素。另一个因素是,由于它缺乏区分声母、韵母的功能,上述全拼输入的强大智能化组词功能如用在双拼法中,将使字词之间的重码大量增加,使得本来就受到困扰的打单字问题变得雪上加霜。因而不可能做大。
因此,简化全拼音码,不能将全部复合韵母音节化。但是若将少量关键的复合韵母音节化,使记忆负担极少;而且还保留全拼的见字知码,见码识字的立即性的优点,不失为优化的方案。幸运的是,经过多年的探索,在另一支柱一符双音的配合下,居然找到了这种方案。称之为全拼音码的有理简化,汉字有理拼音码由此得名。韵母经过简化,最多取码两个。以GB2312的一级字为样本,本码的平均码长是2.742,而全拼的码长是3.114。即每字少打0.372键.效率提高达13.5.

汉字拼音有理简化方案简介

 我们把复合韵母分成前、尾两部。尾部有7种情况:a、e、i、o、u、n、ng。ng取码为v。前码的简化也很简单。ia取码为e,ua取码为o。其它为两种省略:n表en,v表eng;一种个案:uu表示韵母迂。经过这样简化,韵母最多取码两个。例如,将jiang字,简化成jev。键jian字,简化成jen。
概括起来,就是四个复合韵母ia,ua,en,eng,做到了音节化,分别被e ,o ,n,v取代而已。
 一符双音而不发生歧音的取法,在双拼法中早有先例。本方案中ev是iang及uang的双韵码就是双拼的产物。一符双韵而不发生歧音是本的巧妙之处。ua简化为o,ia简化为e,o、e就具有双韵功能。为何不发生歧音呢?请看:能与gkh、zhchsh相配的ua、e,却不能与o、ia相配。能与mdtnl相配的e,基本上不能与ia相配。只有俩、嗲是两个例外。不能与jqx相配的e,却能与ia相配。例如,全拼中,宽kuan字在本码中取kon是唯一的宽的发音,不用担心会出现歧音。同样,见jian字在本码中取jen。而变bian字在本码中取ben也不会发生歧音与笨同音。因为笨在本码中的码是bn。根据此法,所有复合韵码,取码不会超过两码。一符双韵实功莫大焉。
 汉字有理拼音码简化复合韵母总结如下
a起                        av表ang

e起                        e表ia,eo表iao,en表ian , ev既表iang,也表uang

i起                  iv表ing

o起                        o表ua,oi表uai,on表uan, ov表ong,也表iong,n表en,v表eng,uu表示韵母迂(在n、l之后)

有理音形码简介

对于音码来说,速度不够快,对于非专业打字员来说,还不是问题。但要做到盲打,首先必须解决字及词组的重码问题;而这绝非人工智能力所能及的。因此眼睛保护问题,虽至关重大,众多成熟码专家,也因难以解决,形成熟视无睹,甘拜下风。另一方面,重码太多,也影响人工智能取得突破性的进展。用优秀的笔形码来大幅度的减少重码,是提高音码打字效率、减轻眼睛疲劳的易学易用的唯一办法。同时也为人工智能的最后目标,即整句输入,找到了得力的助手。
  部件的选定。
  在音形码中形码的部件的选定必须少而精,才能做到易学易记。取码时要做到不发生字的拆分问题,易用问题就迎刃而解。本码的部件分六类20多个。见下表
————————————————————————————————

  码   1    2    3   4   5     6
单笔形  横挑  竖丨亅   撇点  捺   折弯
复笔形     二(连续   三(连续    人八形   口
        两横笔   三横笔)   (含午字首)

本形码总设计3个键码,后两键是数字键。
第一键码称为首笔部首码,把涉及首笔形的部首[注的笔画数,与笔形码配对,在键盘上用行列法构成一个键码。行列排法见下列键盘的示意表:

—————————————————————————————————
 Q  W   E   R  T   Y   U  I   O  P
二1  二2 二3  二4 二5  五5  五4 五3  五2 五1
 虍  卜  扌巾  王  示业   钅    纟己马  阝  竹羽
——————————————————————————————————
 A  S   D   F  G  H  J   K   L   ;

一1  一2  一3  一4  一5  四5 四4 四3  四2  四1
雨走  十  大土  甘木 石龙    立疒 火方 宀氵  讠亠  米羊
至 革     廾艹兀        文    忄广 

—————————————————————————————————

Z   X   C    V  B   N   M   ,  。   /
三1  三2  三3  三4 三5 六5 六4  六3 六2  六1

舟豸鱼  亻  彳  月牛爪 鸟禾 目田  日   口     足虫
            毛片

—————————————————————————————————
其中汉字数字代表首形码,阿拉伯数字代表次码。在这里就是部首的笔画数。当部首的笔画数大于5,一律作为1。
例如‘码’字,首笔形为一横,其码为一,部首石的笔画数是5。‘一5’的行列合成键码为G。
当然该表中所列部首,是不可能穷尽新华字典上约180个部首的。其中‘扌’的笔形码取为二,而不是一,是唯一的特定。
第二键码又可称为终止码。基本上省略了通常的选择重码键,提高了盲打的效率。

实际对于一般无太生撇的字情况,使用2键的形码,足以应付。理由如下:

1,GB2312码表中,发SHI音的字共78个。使用2键形码后,重码字28个,4字重码一组;3字重码两组,2字重码9组。

2,对于词组来说,只使用第一键,就能有很高的区别重码能力。虽然我手头没有词组数据,因而不能做重码统计,但用数量最多的、发音为shishi的词组作一个分析,也能说明问题。在22个词组中,只有两款重码,即(事11事11,世11事11)及(时64事11,时64世11)。对发音为jishi(即使、疾驶、继室、纪事……) 的19个词的分析,也只有一款重码组。说明首笔部首码有很强的区别词组重码的能力。首笔部首码的易学易用,应该是不在话下了吧。

统计数字能说明这3键形码的区别重码字的能力。在GB2312的一级字符集(3756个)中重码只有152个。重码率为4.0%。而且三字重码只有两组。连同二级国标汉字6770个的重码率为8%。发SHI音的字共78个又加16个特别生撇字,全部是两字重码组,共6组12字。说明盲打不仅适用于国标汉字6770个字,也适用于字数更多的,例如微软使用的版本。
[注部首虽然是小学时代就用熟了的知识,有的字所属部首的确定并非一蹴而就。但在这里使用的部首,并不要与新华字典完全一致。本码的规则是:‘涉及首笔形的部首’。例如,‘智’字,新华字典上的部首是‘日’,但因其首笔形是‘矢’的首笔形,(撇横)它涉及的部首是‘矢’,所以‘智’字的部首在本码中是矢。这对取码的流畅性是有帮助的。

[ 本帖最后由 hu0303 于 2008-01-23 03:18:00 编辑 ]
您需要登錄後才可以回帖 登錄 | 入住家園

本版積分規則

手機版|小黑屋|吳語書院

GMT+8, 2026-9-4 15:53 , Processed in 0.024282 second(s), 16 queries .

Powered by Discuz! X3.5

© 2001-2026 Discuz! Team.

快速回復 返回頂部 返回列表