|
|
發表於 2006-7-18 23:44:59
|
顯示全部樓層
讓我們逐句地研究樓主的想法和意見:
在电脑作为汉字处理的新工具之初,就出现了主要的两个难题:1、输入速度太慢;2、受定量汉字字库所限,不能把所有的汉字都打出来,因此,电子印刷取代不了老式的铅字印刷。全世界的电脑华文输入软件专家们,搞了20多年,至今也不能解决这两个主要难题。一些人原先认为不是汉字的原因,而是电脑的功能还达不到的原因,寄希望于电脑的进一步发展。20多年过去了,电脑的运算速度由每秒一百万次上升到四百亿次了;汉字输入的方法,能用的全都用上了-----键盘输入、手写板输入、扫描输入、语音输入(这些方式都是建立在现有的汉字字库基础上的);电脑的“思维能力”已经超过人的思维能力了;而这两个难题仍然没有解决。
060717回=> 樓主如此說, 這兩個問題是電腦無法解決的啦。來研究一下樓主的理論是講甚麼?
1. 所謂「输入速度太慢」 : 請問現在樓主所見的速度是慢成怎樣的慢? 如何速度才算不慢? 相信是要跟英文的打字輸入比吧, 一般英文打字每分鐘也不過250字母而已。請看:
1) 中打競賽中得到每分鐘220字的成績, 老外打英文也不一定達到這個速度呀!
http://inputclub.foruto.com/cgi- ... 14440&SID=38775 (每分鐘220字)
名次_名稱________選手____記錄日期___每分字數
====_========____======__==========_========
_1___大新倉頡____廖于萱__2002.04/16___220
_2___行列________洪秀權__1997.04/27___215.5
_3___嘸蝦米______李筱涵__2000.06/01___209.1
_4___華象________陳偉恩__1994.06/06___196
_5___縱橫碼______滕克恬__2004.10/23___185
_6___大易________許育菱__2000.06/01___184.0
_7___全方位倉頡__姚偉昇__2003.08/02___167
http://inputclub.foruto.com/cgi- ... 8495&SID=351460 (每分鐘203字)
http://www.eztyping.com.tw/fram/aaa_fram.htm (大新倉頡主頁)
所以, 相對於孫先生最關切的輸入速度而言, 這個事實已充份反駁了他所說的
「输入速度太慢 」。abc系統文字的打字, 再快, 一分鐘也不過如此速度而已。中打何時比英打慢?
2) 再者, 漢改高手一再強調輸入速度問題, 但一般人用電腦並不只是以輸入文字為主,
也有錄音, 畫圖, 錄影(攝像)...等及其再編輯; 用電腦編輯出版一本書, 也會有圖,
打字並不是全部。
3) 還有, 倉頡發明人朱邦復先生說過, 打字快並不見得是好事; 打字太快, 對手指是一
種職業傷害。漢改高手一再注重的輸入速度, 是把注意力太過集中一事而忽視了其他
好多好多方面了。
現在的英文鍵盤安排, 也不是最快的, 目的也是不要有打字職業病。
4) 請問電腦的用途只有「打字」一途而已麼? 中文電腦的便用, 只是為了要跟英文電腦
比拼輸入這一項而已嗎?
5) 漢改高手一再強調中文輸入慢(連慢到如何的數據都講不出來是每分鐘多少字), 把這
不是事實的假事說成真的, 再擴大為是中文電腦的唯一致命缺點。這到底是陷入了幻
想症, 還是在鄉村生活沒見過真正進步的中文電腦, 還是先生不曾學到更好的中文輸
入法, 還是不知真實的電腦使用並不只打字一途, ....., 看來像是一個無知的鄉巴
佬在講話似的。
6) 以前先生還有對中文輸入有一偉大評語: 有重碼問題無法解決。這也是站在一個絕對
的、脫離現實的角度來講話的。現在的輸入法軟體已進步到自動選字, 即是無自動選
字, 重碼也不影響真正的輸入速度。先生以為所有輸入都跟單純的原始漢語拼音一樣
, 打一個音便出現上百個字給你選的那種麼?
2. 所謂「2、受定量汉字字库所限,不能把所有的汉字都打出来,」 目前支援的Unicode
Ext B字集共有七萬多字的輸入法, 就有倉頡、海峰五筆、陳橋五筆...., 先生工作中的
打字能用這麼多字麼? 由古至今有十萬中文字, 但一個普通人工作中也只用到1000多字
而已, 這已是很多了, 一個文字工作者, 如作家也不過用到3000字左右。要用到最多不
同的字的, 要數戶政機關, 他們要為地方政府登錄居民的身份證人名地址。中國人喜歡
用生癖、怪字來起名字。這些用途, 有好幾萬字, 也遠不到全部的十萬字, 所以其他沒
用的都是死字, 但是為了保留所有的中華歷史的文獻, 電腦要全部包含這十萬字; 而一
個專門研究文字學的人, 也不見都全用得到十萬字。可說, 在電腦越來平宜趨勢下, 繼
續擴充包含全部有史以來的十萬字, 還包括了越南用的字喃漢字、日本用的和製漢字、
和朝鮮韓國用的諺文漢字。這對電腦來說是簡單的事, 重點是Unicode Ext C字集的擴充
, 要由人力來收編, 而目前也進行得很順利。先生所說的「字庫」是指字形庫, 如果系
統不提供, 人為建立新字形即可, 一點技術難度都沒有。先生卻把這小小的事情, 描述
成「兩大無法解決」的大問題。
3. 先生下了一個結論說成了: 「因此,电子印刷取代不了老式的铅字印刷。全世界的电脑
华文输入软件专家们,搞了20多年,至今也不能解决这两个主要难题。」
現在的中文出版印刷, 都是用電腦排版、電射印表機(激光打印機)印刷, 先生講的是那
一年代的事啊? 先生的頭腦及記憶怎麼還停留在1960年的時代? 真是怪了, 讓人差點誤
會了這是哪裡來的井底蛙, 在亂叫。
4. 先生還說: 「电脑的“思维能力”已经超过人的思维能力了;而这两个难题仍然没有解
决。」 電腦運算能力本來就比人強、快, 否則我們要電腦做甚麼? 先生這麼說, 好像要
追溯到1947年第一台用真空管的電子計算機(真正的只能作計算一種用途), 由那時開始
至今都解決不了, 這麼嚴重。看來, 先生的見識還真的嚴重短缺、陳舊、幾可達到比無
知還嚴重的幻想症地步。
为什么呢?这好比用一把剪纸的剪刀去剪钢板一样,原料与工具不对路。既然让电脑适应汉字不行,为什么不改进一下汉字,让汉字适应电脑呢?
060717回=>
先生還比喻說成: 「用一把剪纸的剪刀去剪钢板一样,原料与工具不对路。」於是進一步說成了「让电脑适应汉字不行」。令人為先生的見識搖頭。
从历史上看是有其成功的先例的,每一次新的文字工具的出现,都使汉字发生相应的改进变化,以适合新工具的处理:当毛笔出来以后,篆字改成了隶字;当刻板印刷术出来以后,楷体变成了宋体。
060717回=> 先生所說的漢字歷史, 「每一次新的文字工具的出现,都使汉字发生相应的改进变化,以适合新工具的处理.....」, 完全是套用自馬克思唯物史觀而編造出來的謬論、假歷史。真是不學無術, 又好發謬論。馬克思史觀再對, 卻不完全適合於中國歷史情況, 他未研究過中華文明、中國的文化歷史。「当毛笔出来以后,篆字改成了隶字」是說, 有人發明了毛筆(先有了物), 於是才產生了隸書, 像是一個突然的發明, 轟動突變。其實春秋未期, 隸書和小篆並行好幾百年, 在民間(尤其被秦統一的楚越等南方地區)排拒秦的書同文政策, 因為書同文後楚文字給消滅, 完全改為秦的小篆, 所以反而隸書使用人逐漸變多, 小篆在北方朝廷使用人相對變少, 到漢時朝廷採用隸書而使秦小篆完全退出歷史舞台。
而「当刻板印刷术出来以后,楷体变成了宋体」, 這只是刻工為方便而造成的字形, 更正確說是某些異於手寫的筆劃特徵, 這宋體只是出版品上的字形, 卻不是正式書寫的字形。其實宋體根本就是楷書體, 並非獨立於楷書之外的另一字體, 隸書相對於小篆是另一種書寫字體, 宋體(又名印刷體)就是楷書的印刷形式而已。手寫的楷書和印刷的宋體, 兩者沒非不同的字體, 像圓體、細明體、華康標準宋體、勘流亭....等等, 都是楷書, 你能說它們是另一種書寫字體? 這也真顯示出先生的書法知識、書法歷史是多膚淺, 其實網上搜尋一下, 資料多的是, 不懂也會懂了。這不禁令人回想到文革時, 有幹部說本公社今年可比往年增產3倍.....云云, 到底如何增產、如何調配學習人力、生產環境、技術, 都沒有一個數字或腹案。成了順口開河了。
现在,新的现代化的文字处理工具-----电脑出现以后,为什么不能处理好汉字?根本的原因就是1、汉字在构件上没有标准件可用;2、在组字上没有规则可循。而机器生产是必须预备这两点的。目前的汉字,笔画最少的只有一笔,最多的有52笔;在组字方式上,随机性太大,无任何规律可寻。这样的东西只能用手工才能生产出来,根本无法用于机器生产。所以,只有把目前的汉字改进成由标准件按一定规则组成的新汉字,才能适合电脑的高速处理。
060717回=> 「电脑出现以后,为什么不能处理好汉字?」明明先生就是用電腦打字、上網、在論壇裡發表謬論, 卻又講這樣的話, 確實令人不知所云。電腦不能處理好漢字, 你能上網? 若指有些字打不出來, 一是你所裝的字形庫軟件不夠, 快去上網捉吧, 網上免費軟體freeware很多。
「根本的原因就是1、...没有标准件..;2、...沒有规则...。而机器生产是必须预备这两点的。」生產? 你明明在電腦上打了中文, 而你的電腦明明在顯示了中文, 卻說「不能处理好汉字」。「没有标准件」和「沒有规则」是你看在中文輸入這步驟上, 先生是要搞中文輸入法的搞不出來, 那是先生的聰慧仍不足, 慢慢思考必可成。
「目前的汉字,笔画最少的只有一笔,最多的有52笔」先生的中文字知識真不足! 最多筆劃的中文字是𪚥(四個龍字放在一起), 和𠔻(四個興放一起), 都是64劃。(先生的電腦不能顯示的話, 請安裝Unicode Ext B集字形吧:
這是海峰五筆主站提供的中日韩汉字超大字符集(SuperCJK)通用字体支持包V3.0 http://okuc.net/software/UniFonts.exe (下載安裝, 請放心, 無毒, 我用得很好。)
「这样的东西只能用手工才能生产出来,根本无法用于机器生产。」這是在說瞎話, 一個中文字, 可以怎樣「手工生產」? 又怎樣的「用于机器生产」? 你電腦不是好好地正在為你工作嗎? 還有, 它也可以打印。
「『只有』把目前的汉字改进成由标准件按一定规则组成的新汉字,『才能』适合电脑的『高速』处理。」不知先生的電腦是甚麼電腦, 使用甚麼系統? 『只有『...『才能』...『高速』, 先生電腦很慢嗎? 請買使用Itanium或Pentium 6的主機板的吧! 但既然未把「汉字改进成由标准件按一定规则组成的新汉字」, 所以也不會「快」了。這有個例子具有很好的異曲同功之炒的: 因為「簡化字比較有效率」, 推論出 => 所以, 把電腦設定成使用簡化字, 效率將提升不少, 所以同一牌字同一規格的電腦, 大陸因為使用簡化字, 所以會比香港台灣的快而有效率得多了。同樣的一台印刷機, 大陸用簡化字字模, 會比香港台灣的印刷得更有效率更快了。哈哈哈, 各位好笑不?
由于汉字不能象组建英文那样用标准件(拼音字母)和组字规则组建汉字,那就只能对汉字进行整体加工了:即把一个个汉字当作一张张小图片来存储和用文件名检索的办法来调用。这样就必然出现重码字问题。目前的汉字库一般存字7000个左右,重码字最多的达到469个,重码字越多打字就越慢。据说汉字目前已经达到70000多个,如果全部纳如字库,最多的重码字可能要达到几千个。电脑要首先从70000个字中逐个鉴别出所有的同码字来,然后打字者再从几千的同码字中寻找出一个需要的字来,要费多少时间?再说,随着社会的不断发展,新汉字还必须不断地增加,字库就不断地膨胀。这样将使汉字的输入越来越复杂难用。
060717回=>
這段話是最離譜的, 是看似懂電腦而底子裡完全不懂電腦的人講出來的廢話。我們來一句一句地研究, 這段話的荒謬。
「由于汉字不能....用标准件(拼音字母)和组字规则组建汉字.....这样就必然出现重码字问题。」先生是在談輸入法啦, 卻又不明白地講出來, 也許, 因為電腦知識不足, 根本不懂得這其實就是輸入法。每一種輸入法都有不同程度的重碼, 拆字為基本組件是研究輸入法的第一步。日後以基本組件(字根字形)來組字, 其實是以不同鍵代表不同字形字根, 這就是所謂外碼。打了外碼, 電腦的輸入法軟體會依外碼轉成對應的中文字內碼, 這時在電腦內傳輸、儲存的全是01010的內碼。重碼是指根據輸入規則打字, 同一外碼鍵組合代表了一個以上的字, 這時便有選字表來選取所要的。這個重碼使輸入後, 多一個打數字選字動作, 相當於多了一按鍵才把要的字打出。重碼率高, 如拼音類最高, 要選次數多, 但打字多了對選字位置也熟弓, 影響輸入也是有限。重碼率只是作為評比一個輸入法的優劣時的一項特性而已。理想的輸入法是一碼一字, 而事實要百份之百一對一是做不到。但, 重碼卻不是缺點的一切、全部。輸入法還要看字根佈局、對應, 規則等等的方便性, 好記性等等。
「目前的汉字库一般存字7000个左右,重码字最多的达到469个,重码字越多打字就越慢。」字庫存字字數和一個輸入法的重碼率有甚麼直關係? 而7000字字庫有重碼字469個, 是指哪一個輸入法? 這數字又從哪裡來? 重码率完全依不同輸入法不同而不同。倉頡就是一個專業水準, 重碼率極低的輸入法:
1. http://www.zhsc.com/b5/down/help/fm_cjbig5.htm (方旻倉頡輸入法網頁) : 「標準的倉頡輸入法是一種重碼率很低的中文輸入法(約500多個重碼)。」
2. http://www.geocities.com/Tokyo/Dojo/1924/ (余氏輸入法簡介網頁) : 「余氏三碼倉頡重碼特少,常用字的重碼率低於1%。次常用字的重碼率約為3%。」
3. http://www.geocities.com/mycj3/mycj-15.html(【我的倉頡】網頁) : 【我的倉頡】以五萬多字為研發基礎, 比其他輸入法重碼低太多
4. http://zh.wikipedia.org/wiki/%E4 ... 3%E5%85%A5%E6%B3%95 (維基百科介紹《倉頡輸入法》): 目前最新的公開版本是第五代。待公開的第六代,為十萬字庫設計,重碼率低。
倉頡目標以全部十萬中文字作研發基礎編碼, 若拿來用在國標碼的六千多字, 重碼實在是低到可忽略了。
5. http://www.china-e.com.cn/main/zhengma/xw-4.htm (郑码网的網頁) : 「共11050个汉字进行了编码,重码字130字,占总编码字数的1.2%。」
6. http://www.pinyin123.czm.cn/zhangma/index.html (張碼輸入法網頁) : 「3、重码率低:在GB2312-80字符集6763个汉字中,重码不足十对。」「在GB2312-80汉字字符集中,张码输入法的汉字重码字只有七组共14个汉字!」; 「(众所周知的五笔字型重码为249组)。」
上面的這個網頁右邊有多篇研究重碼的文章, 既然對重碼有興趣, 請研讀。
7. http://www.pinyin123.czm.cn/zhangma/zmw1.html 《典型输入法重码发生的绝对几率》, 這文章計算出: 「从这个原理上来说,以26个字母键、码位数为4编码的输入法,其重码发生的几率所产生的重码为100对。」也即, 「每输入1个汉字字符,其重码的发生几率为:67.58分之1(456976除以(6763-1)=67.58)」, 67.58分之1即是1.479%。
8. http://www.pinyin123.czm.cn/zhangma/zmw6.html 《理想的重码字数应该是多少?》: 「一般来说,重码越少的输入法越难学,所以并不是重码越少越好。我觉得,重码指标为2.5左右时,在易学易用方面可能是最均衡的。」
9. http://www.pinyin123.czm.cn/zhangma/zmw12.html 《试探重码、简码、补码与输入法效率 》: 「用户常常有一个错误的看法:重码越少的输入法打字速度越快。于是一些输入法开发者就用“重码很少”或 “零重码”来取悦不明真相的用户。实际情况真的是这样吗?不见得。通过赛码我们发现,一些重码很少的输入法其输入法效率并不见好。它虽然减少了看屏和选键,但总按键数并不见少。」
10. http://www.pinyin123.czm.cn/zhangma/zmw14.html 《五笔的重码字(86)》: 「以上是五笔字型(86)的所有重码字,共有249组,510个。五笔的重码率((510-249)/6763)为:百分之3.86。」
11. http://www.chinatrm.com/2006/3_29/231.html (天然數碼港網頁)《探访天然码输入法的深层奥秘》: 「天然码的单字重码率是百分之一,而五笔是百分之六,」
講了半天, 只在小小的輸入法上兜圈子。電腦中文的處理就只有這樣一件小事麼? 何以先生是如此井蛙之見。但, 講重碼, 卻又沒有我的如此高見! 只要到網上查尋一下「重碼率」即可查到好多相關研究文章, 連這個也不會找嗎? 先生說的「7000个左右,重码字最多的达到469个」, 等於重碼率6.7%。我在上面所列的十一個網頁資料, 都沒有一個高過你所說的。先生是何處來的誇張數據!
「据说汉字目前已经达到70000多个,如果全部纳如字库,最多的重码字可能要达到几千个。」真好笑, 在6. 所示張碼輸入法網頁, 即有有關重碼的幾篇文章, 請去看一下再來順口開河。重碼是一定依比例遞升的麼? 這實是一個單純的臆測。若有, 那就是大陸不重視文化、要滅方塊字的結果造成了文化短視, 国家标准GB2312-80全部的汉字,共6763个是抄自日本工業標準JIS的! 以六千多字為基礎的字集所承載出來的文化體, 起碼就已把五千年文明腰斬為二千年了(日本, 由漢朝算起開始吸收中華文明的滋潤了不起才二千年。) 但是小小的台灣, 卻率先發明了倉頡輸入法, 以全部十萬字為基礎編碼研究, 是所有輸入法之最, 重碼仍是低的。
「随着社会的不断发展,新汉字还必须不断地增加,字库就不断地膨胀。这样将使汉字的输入越来越复杂难用。」 先生把字和詞都弄混在一起了。以既有漢字造新詞, 全世界唯我中華可做得到。其他的文明都是社會進步、科學新名詞都是重新編新詞, 因為它們用abc或字母拼音, 只能拼新詞, 另一個全新的音的組合。如大陸所講, 6700餘字足矣, 再有新詞也只是這六千多字在組合而已, 字庫何以會「不断地膨胀」? 再者, 為文化傳承請命的倉頡發明人朱邦復, 使第六代倉頡面世, 針對的全部由古到今的漢字也才十萬, 不可能再增加了。甚麼「随着社会的不断发展,新汉字还必须不断地增加」, 亂講!
「这样将使汉字的输入越来越复杂难用。」這也不通, 漢字字數增加, 怎會使漢字輸入越來越復雜? 除非如大陸那般短視, 只識那區區的六千餘字吧?
還有, 先生可能沒看過新華網的報導: http://big5.xinhuanet.com/gate/b ... content_4591948.htm 「教育部、國家語委透過統計15種報紙,得出2005年漢字使用情況。專家根據報告得出,漢字和詞語的覆蓋率非常高。581個漢字就可以覆蓋語料的80%。也就是說,認識使用頻率最高的581個字,就可以讀懂媒體文字的80%。當覆蓋率達到90%的時候只需要934個字。當覆蓋率達到99%的時候需要2315個字。對於詞來說,了解4000條詞語,就能看懂80%的報紙;了解1萬條詞,就能看懂90%。國家語言資源檢測與研究中心表示,掌握1萬多條詞和900多個漢字的人,就可以閱讀90%左右的報紙。 」
怎樣, 「認識900個漢字 能看懂九成報紙」, 先生真是對文化那麼重視, 是認為900字不夠, 要十萬中文全收麼?
目前电脑在调用汉字方面,与用老式的铅字打字机相比,没什么本质的变化。只是把铅字字盘换成图形字库罢了。所以,先进的电脑给汉字带来的好处是很有局限性的。有人说用“词索编程法”可以提高输入速度。其实,“词索编程法”除了让电脑先从70000个汉字中找出同码字外,还必须再根据这些同码字再关联出词或句来,这样一来,汉字打字程序将十分复杂和庞大的,并且也不能避免同音词和同音句。为了减少同音词、句的数量,有人提出把汉字限制在几千个左右。这就像看着百万雄师因指挥不了,而弃置不用,只能指挥几十个人的小分队搞小打小闹一样。
060717回=> 講到這裡, 還在大談特談輸入法, 先生對電腦的知識和瞭解真的只是停留在輸入法, 先生眼中電腦的工作只有文字輸入而已! 連這樣無知的話都講得出來: 「目前电脑在调用汉字方面,与用老式的铅字打字机相比,没什么本质的变化。」其他電腦功能不談, 光是一個輸入法, 如何由鍵盤輸入外碼, 到字形庫取字顯示及打印過程, 由這句偉論看來, 真的是一竅不通。
「先进的电脑给汉字带来的好处是很有局限性的。」看來先生只懂得用外觀的硬體去揣測電腦的運作原理, 卻不知更重要在於軟體的撰寫功力及技巧。同一台電腦的同一個工作, 不同功力的人寫出的程式(編程, 程序), 運作起來就來就是有天淵之別。若先生認為有局限性, 請學一下台灣瘋子朱邦復先生, 親身下海研發中文電腦, 把英文電腦變成懂得中文的機器吧。http://www.zgyuyan.com/discuz/viewthread.php?tid=1426 中国语言论坛 |
|