|
|
發表於 2006-8-10 01:40:35
|
顯示全部樓層
現在來看一下樓主所轉貼的本文吧。裡面謬論多的是! 我來一句一句地抓出來檢驗。
(一)....「当时,最流行的一个说法是:联合国文件中,汉字印刷的文件最薄,所以,汉字比英文等文字更优越。」
==> 「联合国文件中,汉字印刷的文件最薄」這是事實, 不能說不是優點。在電腦時代, 我們不要比文件的厚薄, 我們來比電腦內中文所佔用的內存空間。內存記憶體及磁碟的成本, 在考處其儲存成本時是用每個位元(比特bit)得花多少美元來計算的。各位可以自己做實驗, 去找多篇英文文章翻譯成中文, 於是同一內容的文章, 有了中文版和英文版。這是再算一下, 英文字母多少個, 中文字多少個。一個英文字母是一個字節(即8個位元(比特bit)), 一個中文字是2個字節(即16個位元)。以字節來計算, 中文版的字節數是英文版的60%以下。光是儲存成本, 存取、傳送所耗時間, 中文版只有英文版的60%。哪個優越?
「如果汉字的部首笔画也用单线字符串方式,那么,一个汉字所需要的单线长度往往超过英文字母方式」
==> 本句前面講得好, 「做任何比较都有个起码前提:条件和方式相同。」但是這句話, 說以單線字符方式寫中文字部首筆劃是不可能有的假設, 中文就是因為是寫筆劃才能優越, 作者試圖以寫字的線條長短來比, 實在是比得不合適。英文字母是固定的定型符號, 再變也只能作線性的排列組合的變, 能變出甚麼花樣? 怎能變成二維空間的搭配組合呢? 同一書寫空間一個方形格內, 中文字可以有十萬個變化的事實(且不算理論上的所有筆劃全集合組合有多少個--這個理論值是更高於十萬的), 那還是有意義的字(尤其單字詞); 而英文字母只有52種變化(含大小寫), 在同一個方形格裡只能有一個無意義的字母。給你同樣的書寫空間, 中文可以表達的事物比英文可以表達的多。
「如果英文词汇也用平面绘画方式,那么,它所需要的平面空间与汉字差不多。」
==> 英文字母是無法寫成平面二維組合的, 這個「如果」是一個完全不會發生、甚至人為故意也無法發生的假設, 這樣的說理, 完全是空中樓閣。
「“中国人”用三个汉字符号,英文“CHINESE”用七个不可再分割的书写符号单线串写而成。然而,如果汉字也用不可再分割的符号以单线字符串方式书写,例如部首笔画,那就有“竖、折、横、竖”等14个符号,比英文的字符串长得多。」
==> “中国人”三字有十四筆劃, 但這裡中的4筆劃、国的8筆劃、人的2筆劃, 都是不可分割的, 一分割即是毫無意義的筆劃, 再也不是這三個字了。作者一再強把中文分割為筆劃再來轉化為單線字符的說理方式, 是昧於事實上兩種文字的書寫結構的差異。本來即是二維平面的卻硬拆作一維線性。 所以, 我說, 電腦時代, 一切以電腦為中心, 就以電腦內中文和英文的文檔比較是最理想的比較了。同一內容, 中文版文檔所需容量只有英文版文檔的60%。是不是「薄」很多呢?
「(二)“汉字优越”论的鼓吹者们说,汉字平均信息量大,所以,汉字比英文更优越。」
==> 這是錯的, 錯在這些人不是通訊專業人才, 他們最多只可能是電腦資訊專業人, 但卻不下點功夫去看看書, 瞭解一下真正的所謂「平均信息量」這個錯名詞(真正英文技術原文, 根本沒有這個「平均信息量 average information amount/quantity」的東西)。也錯在他們沒有真正用心搞懂甚麼是「平均信息熵average information entropy」。信息熵, 是一個通訊傳輸上的設計觀念。
「信息学基本原理说明,某数据所使用的符号系统的平均信息量越大,它的不稳定性和消耗就越大,对数据管理和信息传递是不利因素。」
==> 這是對電腦、通訊只懂一半的「半桶水」說的話。應該說: 「某語文符號系所使用的數據的平均信息熵越大, 其在通道channel(通訊道路, 一個假想的路)在選取一特定符號的機率就小」。機率小, 竟然轉講成了「不稳定性」, 真是天啊, 我好像在教幼稚園小孩! 這裡頭還加鹽添醋多了個「消耗」的怪觀念。這完全跟機器或系統的穩定性、消耗無關! 只是用機率概念在思考、設計通訊上選取一特定符號的數學模型而已。本謬論還擴大解說成:「对数据管理和信息传递是不利因素。」數據管理已是這個機器運作設計層次之上的「作業軟體」之上附加的應用軟體運\作之上的再附有的資料庫(數字庫database)管理那裡了。隔了好幾個層次, 卻全攪和在一塊! 「信息傳遞」麼, 是傳輸一篇文稿的文字啊, 文字都已在文稿內定好了, 電腦只是依打字存檔內的中文字內碼, 直接傳內碼而已, 都是0和1的訊號, 還有甚麼「信息传递是不利」和利的?管你英文、中文、印度文、非洲文...., 都是0和1啊!
在閃農提出信息熵原文的文獻裡(網址如下), p12 由本頁底部倒數8列: The uncertainty(or entropy) of the joint event....... 這個熵entropy其實是一個不確定性的衡量數字(確實說, 是機率), 相信是半桶水的人, 把不確定性uncertainty譯成不穩定性吧。再由此引申出一個所謂「消耗」的說法。
http://cm.bell-labs.com/cm/ms/what/shannonday/shannon1948.pdf
或 http://pespmc1.vub.ac.be/books/Shannon-TheoryComm.pdf
「英文平均信息熵是4.03比特左右、汉字是9.6比特左右,汉字平均信息量比英文符号大许多。做同样的数据作业,汉字符号系统的总体消耗最大,其信息量大是不利因素。」
==> 這個平均信息熵是指一字符集中, 某一特定字符出現的機率。由於0.xxx這樣不好看清楚作比較, 便再把這個數字取其負的對數(即倒數了, 不再是0.xxx方式), 又因電腦使用2進位, 所以取對數是取以2為底的對數, 這樣得出的數字, 給了一個叫位元(bit比特)的單位稱號以表達之前對機率所作的變形運算, bit即二進位數字BInary digiT的縮寫。汉字是9.6比特, 表示漢字的全字符集合的字數多。問題來了, 「做同样的数据作业」是指傳送同一內容的文章吧? 請問同一內容的文章, 英文只要用26個字母, 而中文都要用上全部十萬漢字嗎? 如果是, 那由一個不懂電腦的人口中說出: 「汉字符号系统的总体消耗最大,其信息量大是不利因素。」這樣是好像對的, 有道理的。(註: 那, 一個懂電腦的人又看到甚麼實情? 請看下面的註) 事實, 沒有十萬中文字全都傳送出來, 因為平常中文用字也不過二三千字而已。再者, 符號集字數多, 總體消耗量就多? 這是那門子的電腦概論, 是哪位教授教出來的學生在胡言亂語? 符號集字符多, 和平時作業要傳輸處理的字符有甚麼關係? 電腦內有日文平假名版假名的符號, 有印度文、泰文字母, 有俄羅斯的字母, 各位不使用日文、印度文、泰文、俄文的人會用到嗎? 電腦放著額外不用的這些外文字符, 會使電腦消耗更多電能、阻礙電腦處理中文嗎? 同理, 十萬中文字放在電腦裡, 絕大多都是古字死字, 平時只用那二三千字而已, 會使電腦消耗更多電能、阻礙電腦處理中文文檔麼? 說「會」的人, 小心把人家大牙笑掉找你來賠償!
註: 再來看, 懂電腦的人都知道, 電腦通訊, 及電腦內部傳輸, 如處理器、內存、磁碟、螢幕、印表機之間, 所傳的全是內碼, 就是GBK, big5, UTF...這些編碼, 也即0和1兩種符號的代表訊號而已。根本不是在傳十萬中文字, 或二三千個常用漢字, 或26個字母。所傳的數據串即是0和1的組合串。
有關信息熵的誤解謬論, 請看下一樓專文貼出。
「据海内外专业人员考察分析,汉字和英文等文字符号系统的平均多余度差不多;也就是说,汉字平均信息量大,并没有换来更高的精密精确度、并没有换得更可靠和更有效地避免歧义的实效。要达到大体相同的精密精确度和可靠性,汉字符号系统的消耗比英文符号系统高出许多,能说汉字比英文更“优越”吗?」
==> 汉字平均信息量, 或信息熵扯完了, 現在又扯上甚麼「平均多余度」。冗餘redundancy(大陸叫多餘, 這個譯名很不適當), 是在傳輸數據時, 額外多傳一些位元(比特bit)作為偵錯error detection, 或自動改錯auto-error correction機制的資訊。冗餘是數據在傳輸之初, 運用一機制(叫方法論algorithm), 自動運算出一些額外的改錯碼, 附在要傳輸的數據之後。數據傳輸到目的地後, 冗餘便經由同一機制反運算回來, 用以檢查所傳輸來的碼是否正確, 有錯即知錯在哪裡而作自動改錯回來, 改錯後才用作運算或處理。冗餘是由系統設計者加上去的, 當定好一個方法論algorithm機制後, 便成形了。它不是天生的, 故甚麼「汉字和英文等文字符号系统的平均多余度差不多」, 講到似乎是人力不能勝天這樣的口氣。其實, 由米阿仑的《从信息熵角度看中文软件和中文信息业的发展》帖中, 及網上其他言論, 原來始作俑者是這樣看事情的: 一個字節byte8個位元bit, 英文字母abc使用ASCII編碼, 只需7個位元bit即搞定, 於是8個bit即「多余」了一個比特bit(位元), 可作為redundancy之用。所謂「多余」即從這個redundancy的原始出處, 也即當初通訊系統設計時, 這個多出的"無用"之bit。英文的redundancy有重覆的意義, 日後數據自動偵錯及改錯技術(都在編碼學中發展出來的), 便真的額外加入了冗餘用的字節(位元組)redundancy byte。作者後面這句「汉字平均信息量大,并没有换来更高的精密精确度、并没有换得更可靠和更有效地避免歧义的实效。」即在看到了信息量的比特數, 認為中文字要9.6比特(位元)才可以夠傳輸用(天啊, 那是機率的變化表現形式, 是馮志偉針對二萬多字搞出來的, 比起十萬還遠呢), 於是, 一字節才8比特(位元), 便大喊「不夠了, 沒空間容納冗餘了」, 所以「沒有換到精密精确度、沒有更可靠、沒有更有效地避免歧义」。這是信息熵和冗餘兩種觀念作了錯誤的瞭解後, 又再湊在一塊造出新的謬論假說! 後面的結論反問: 「要达到大体相同的精密精确度和可靠性,汉字符号系统的消耗比英文符号系统高出许多,能说汉字比英文更“优越”吗?」就是「錯誤+錯誤」結婚的新生代觀念。
「见到“大”就是好,占领了许多人的头脑,于是,见到“汉字平均信息量大”、就望文生义地以为那是多么“优越”」
==> 這句批得中肯。但是緊接的這句「殊不知那是中文数据管理和传递的不利因素。」是胡說八道。不過, 奇怪, 錯有錯著吧? 再緊接著這句「以“汉字信息量大”作“汉字优越”的理由,是违背信息学科学原理和基础知识的。」反而是罵得很對! 因為那些“汉字优越”論之徒, 和批評“汉字优越”論的人一樣, 是學而不思、學藝不精、半桶水的哇哇叫。
「(三)“汉字优越”论的鼓噪者们说,计算机操作,汉字输入比英文还快,几个键敲下去就能出现整个词组短句,而英文却要一个个字母敲打,所以,汉字比英文更“优越”。这是缺乏计算机知识的说法。
了解计算机输入输出原理的人都知道,文字符号如何显示和键盘操作的关系,完全是人为程序所规定的。......按照同样方法,英文输入输出也编个程序,敲打“Shakespeare_12”就能显示整部《第十二夜》、几十万个英文符号都显示出来了.......」
==> 本來中文輸入即比英文快, 至少也不慢, 詳看:
1. http://www.zgyuyan.com/discuz/viewthread.php?tid=2700
中国语言论坛 |
|