找回密碼
 入住家園
樓主: 关宗灵

【观点】汉语电脑文字的研究

[複製鏈接]
發表於 2007-6-8 14:01:08 | 顯示全部樓層
不懂不要说,中国人整体很勤奋。经济发达国家的人们相对比较懒惰。一个食物链,中国处在比较靠后的位置,所以是在为别人打工。自由经济没有发展起来,垄断太多。

慢慢会好的。

两难,想平稳,必须做末端,想发财,需要冒险。
發表於 2007-6-8 14:10:41 | 顯示全部樓層
通俗一点说:比如一个人,我们形容他的财富(经济方面)时,主要看他的所得;而人的财富就是他所创造的财富,但是后面还有一个分配过程,财富X分配=所得。而我们往往拿所得衡量一个人的财富。

国家也是如此。但无论怎么分配,财富总体是个零,因为财富的实质是产品,产品从无到有生产出来,被从有到无地消费掉。财富的形式是价值,价值只是一个尺度。
發表於 2007-6-8 20:12:07 | 顯示全部樓層
富而不贵
發表於 2007-6-27 20:48:34 | 顯示全部樓層
現在來給#1樓的正文捉捉小鞭子, 看其觀念的毛病:
一 前言
1.「80年代初围绕汉字信息处理问题,中国产生了无数的‘码家军’」
   一提到80年代碼家軍, 可能許多人不知, 那是受了外國記者報導的激發: 「外國記者用電腦打字送新聞稿, 中国記者用紙筆作速記寫新聞稿、傳真發稿回報社。」要面子的中国人一見這樣的報導馬上激起五四情懷, 像是受了重大屈辱似的, 風起雲湧地, 研究起各式各樣的中文輸入法。中文電腦本來就是有需要的, 何以不自動自發地發展, 卻要等到外人來激起, 真像石頭, 不推不動?
2. 「这些编码都只能是单向输入汉字而已,不能读识。凡是操作计算机的人,都需要和机器对话,......都是英语,这是中国人应用和普及计算机难的根本原因.....能有我们自己语言的操作平台。如果没有汉语电脑文字.....世界先进水平。」
   這裡作者把好幾個觀念胡亂揉合在一起。
   1) 他要求編碼(就是輸入法)要讀識, 就是可出利用輸入碼標示讀音, 這只有漢拼或注音符號的輸入法才辦得到, 筆劃類的輸入法就是把中文字拆解成部件, 分配到對應的字根按鍵上來輸入的, 筆劃類輸入法自然不標示音符, 作者的要求就變成是要求所有輸入法一定要用拼音或注音。這是可笑的。
   2) 操作電腦和機器對話, 我舉現在最低層級的個人電腦來說(也只有這層級的電腦才能成為大眾化工具的), 微軟的中文視窗, 不是大家用得不亦樂乎, 都是中文訊息, 中文畫面。作者還興嘆甚麼? 要談編程, 那些英文的指令都是簡單的英文單詞, 根本難不倒人。如果就是看了不順眼, 要用中文指令的編程的話, 事實是有的, 這在技術上是沒甚麼大不了的事, 但中文編程語言的軟體不多, 因為軟體商搞出來了沒有人買, 所以推廣得不好。編程都是懂技術的人, 英文不但難不倒他, 更何況是簡單的英文單詞的指令, 所以要另外花錢去買甚麼中文編程軟體, 實在沒必要; 自然, 其市場就不易打開。而對一般用戶而言, 根本不需要編程。現在微軟中文視窗就簡單易用, 不喜歡微軟的話, 也有中文版的立尼士Linux, 方便取得。作者薯名在某軟件公司, 那自然更應該瞭解電腦資訊界的市場情況才對, 怎會講這種外行話? 說「这是中国人应用和普及计算机难的根本原因」是與事實不符的。如果作者是要文字模式的操作介面, 那就要有中文訊息的操作系統了(操作平台), 這個技術上也不難, 以下就是中国大陸所研發的全中文的服務機及操作系統, 硬體軟體全有了(註)。但怎沒見? 還是市場推廣問題。作者在界業, 怎可不知這天大消息? 還有一重點, 會用到看操作訊息, 定然是較大型的服務主機了, 這種操作大型主機的人都是電腦資訊方面的專業人員, 如銀行內電腦中心機房裡的大機的操作, 那不是給一般普通人去操作的。一般人到銀行領錢存錢, 提款機或櫃台存摺, 不都是中文的操作介面麼? 電腦中心機房內為一般人做事的大機是英文訊息, 對這些普通人又有何影響? 作者如要對這種大機操作環境發出要中文訊息要求, 是無理了。因為中国自己的純中文服務主機和操作系統, 都不好好去推廣到市場, 還談甚麼?
註:全中文服務機及操作系統:
 ┌ 2001-04-30 人民日報 第六版報導 http://past.people.com.cn/BIG5/kejiao/42/153/20010430/456197.html 《“東方紅日”64位服務器開發成功》: 我国最近成功地开发出一种完全国产化的64位高性能服务器及中文操作系统。这一名为“东方红日”的64位UNIX/LINUX服务器和EASTSUN64位中文操作系统是在中科院院士、清华大学张钹教授的主持下,由北京民族恒星科技有限公司开发成功的。
 │  還有: http://gongguan.jhgl.org/info/showinfo.asp?id=129                  国家科技攻关计划
 │        http://news.cic.tsinghua.edu.cn/new/news.php?id=639                清華新聞網 (科技日报 2001年4月26日)
 │        http://news.cic.tsinghua.edu.cn/new/news.php?id=571                清華新聞網 (北京晚报 2001年4月22日)
 │        http://news.cic.tsinghua.edu.cn/new/news.php?id=624                清華新聞網 (2001.04.25 新华网)
 │        http://www.ntem.com.cn/kjjx1/0429_kj_4.htm                  北方技朮网 (《科技日报》2001.04.26 文/段世文)
 │        http://www.chinainfo.gov.cn/data/200306/1_20030611_59692.html
 └ 以上報導不就是純粹中文的電腦產品嗎? 但是, 至今, 市場上還是沒有見到它的蹤影。所以技術不是問題, 重點是市場行銷。先生只在吵吵嚷嚷, 一點實際的事都沒有做(除了那可以使傳統文化傳承完全斷根的拼音文。)
   3) 由上面的操作訊息, 引申出「如果没有汉语电脑文字,中国人的计算机应用水平永远也达不到世界先进水平。」是胡扯了。中國人要的是方塊中文字, 作者扯出甚麼「汉语电脑文字」, 是以漢拼為基礎的abc拼音文, 只是拼個中國話音出來的abc音符, 這怎是中文字? 「中国人的计算机应用水平」就是微軟中文視窗對一般大眾已足夠了, 讀者是否注意到, 作者這句話是在要求一般人也去編程呢, 但, 編程卻不是一般人的事。作者把專業人要做的事, 拿來要求一般大眾也要辦到, 太可笑了。
3. 「汉语拼音方案......与计算机对话和编写程序,它也实在是无能为力。」這句就真的明白表示出作者的意圖, 就是要利用漢拼作基礎的abc拼音文, 當成為在電腦裡的中文來使用。所以才嘆息漢拼在電腦裡作中文的適應性不佳。
4. 「我们到底应该用什么样的编码?是用一种只能单向输入汉字的编码,还是用一种既能注音识字,又能输入汉字,又能实现人机对话并能编写程序的汉语电脑文字?」
    這「单向」指只輸入中文字, 隱喻的雙向便是除輸入中文字外, 還可作注音識字。學生學字是一件事, 學電腦又是一件事, 作者把兩者混一起, 給他所謂「电脑文字」鋪路而已。很簡單, 要這樣, 就用漢拼輸入吧。但作者又加上一條件: 「能实现人机对话并能编写程序的汉语电脑文字」這時就是要求中文編程了。這種中文編程軟體早已上市, 但市場推廣不好, 也比不上原來的利用英文編程的軟體。這不是技術問題, 是市場推廣問題, 作者顯然沒有接觸市場銷售的經驗, 所以把市場少見(作者是連見都沒見到過, 故而少見多怪), 當成技術不可突破的來思考, 再怪罪方塊漢字, 而推出自己的abc拼音字作解決方案來推銷自己產品。
    事實上, 市場未成熟, 這是行售問題, 作者用abc作注音符號代替中文字, 賦予了好聽的電腦文字名稱, 而編程軟體還是面臨重新開發改用這樣的abc作編程指令, 這樣的新一款編程軟體仍是面對市場推廣問題。作者所希望的「大家都可用中文編程」的情況仍不可能出現。編程人員都是技術人員, 用「加」或JIA代表了原本的ADD指令, 用「迴圈」或huechuen代表了原本的LOOP指令, ....., 對一個搞技術的編程人員來說, 沒有甚麼特別好處, 反而把習慣了的事改成不習慣。我是搞技術的, 深知個中的技術習性, 作者是學文的, 不是搞技術出身, 其為設想根本是個多餘的東西, 其擔心的根本是杞人憂天。是一種外行人想領導內行人的心態。
5.「1995年3月3日电脑报有这样一段话:....著名的科学家钱伟长教授早在1986年就曾经指出.......早日托起中国统一的电脑文字。」
    現在是甚麼年代, 2007了, 1986的談話是二十年前的陳腔爛調, 早己爛掉了, 還拿出來作文章? 不是中文電腦之父、那個台灣瘋子朱邦復的發明, 各位漢改人, 全世界的中華人都不會有中文電腦使用。中文電腦輸入中文是要遷就英文鍵盤的26個字母鍵佈局, 才有中文輸入法的。總之, 方塊中文字是打出來了。各種輸入法也還有許多人沉迷其中, 作為文字遊戲。漢改人完全否定中文輸入法的成就, 就是要不用輸入法, 於是也就全盤拿出1956年文字改革的革命式文字暴動, 消滅方塊漢字, 想完全以abc取代中文字, 打abc叫作中文字, 打chung叫作「chung」就是等同於這個「中」字, 打hua叫作「hua」就是等同於這個「華」字, 這才叫作輸入中文字? 原來在作者這個漢改人心中的「中華」竟然是「chunghua」而已。chuanghua就是「中華」麼? 這是完全否定了今日中文電腦的一切成就了。
    說實在的, 作者的「汉语电脑文字软件,并已经取得了国家专利(ZL-95104924.0)」就是漢拼輸入法的衍生版本了。若然本輸入法輸入擊鍵後, 螢幕所示的是方塊漢字, 那便是典型的以漢拼為基礎的衍生版漢拼輸入法。只是加些異拼字母點綴作區分同音字, 反而沒有沒原本的漢拼選字上屏的好。多加的異拼字母, 還不如其筆劃類輸入法的直觀看筆劃, 不需任何思考字義的分類歸屬。打字還要作這種額外思考, 要做盲打就太辛苦了。作者的本文, 其實在作宣傳廣告。
   
二 汉语电脑文字的理论基础
2汉字的组字方式
「概扩起来说,汉字是由无规律排列的无音元素------笔画组合的。这是极其不利于用汉语语音识别的,它不同于西方文字,西方文字是由有限个有音元素------字母组合的,这正是汉字难认,难读,难写,难记的根本原因,也正是汉语语音‘南腔北调’,‘语不同音’的根本原因。中国人识字和推广普通话,必须借助一种拼音字母给以注音.因此,走单纯以字形编码之路,只能是单向输入汉字而已,不能读识。」
    1. 漢字是以象形演化的筆劃來造字的, 不是以音元素來造字的, 所以以音的立場來看中文字, 是沒有意義的, 不管你說有規律或無規律。只有外國人的觀念才是以音來看文字的, 先生把自己變成外國人了。 可是我這個正宗的外國人卻比中国本土的人還懂得中華文字的, 真是怪。難道鴉片戰爭以來, 已把中国人的民族自尊心打垮了? 連自己的文化都要丢棄改用外國貨, 難道外國月亮比較圓?
    2. 「汉字难认,难读,难写,难记的根本原因」, 原來又是回到漢改人的老調重彈, 就是指漢字不表音, 沒有音素符號, 無法看字讀音。於是, 不能讀出音便不識字了。這種錯誤見解的背景觀念就是錯誤的以音通心, 認為沒有音就不能瞭解。也即是, 把文字的觀形識義的主要功能放一邊, 以知音才知義來蓋過一切。這是對文字的誤解, 是摘自西方拼音文的語文理論, 直接蓋在中文字頭上的要求。文字被看成了單純的音符。
    3. 文字是記義的, 不是音符, 把文字看作音符, 大可直接用注音就可。人要表達的意義無窮, 人可發的音有限, 以有限音代無窮義, 本就是一對多的關係。中華文明發展出獨特的中文系統, 完全針對文字本來用處發展--表義。強以西方文化的拼音文來硬套在中華脖子上是不正確的, 這是五四自悲感的延續。西方文字以有限音表義的文字, 發展成多音節詞; 中國人聰明, 在文字書寫符號表達技巧上用功, 故而可繼續以一音節完成全部表義, 而不用發展成多音節的累贅。一個優點卻被五四遺傳的自悲感污染了的可憐蟲, 繼續潑冷水揶揄自家文化。
3汉语语音和汉字的词素性
    詞素, 在形式上即是相當於中文的「字」嘛。詞素, 只是依據西方拼音文的觀念而生的觀
  念, 因為西方拼音文由abc符號(代表音, 曰音素)拼湊後即成詞word, 為分析詞之義的「基
  本結構」而生詞素(morpheme)觀念。
    詞素morpheme是來自西方的語文學理論裡, 專門研究字形學morphology的三種研究模型之一
  , 它是以詞素為基礎的字形學Morpheme-based morphology裡的一個觀念而已。
/-----
     http://en.wikipedia.org/wiki/Morphology_%28linguistics%29
     Models of morphology字形學的不同研究模型
     There are three major families of approaches to morphology, which try to capture the distinctions above in different ways. These are:
     共有三種類研究方法
     Morpheme-based morphology, which makes use of an Item-and-Arrangement approach.
         以morpheme詞素/語素為基礎的研究法。
         morpheme = the smallest lingual unit that carries a semantic interpretation。
         (詞素=負載一個語義解釋的最小語言單位; 它只是語意書寫單位word詞裡面的一個語意組成成份)
     Lexeme-based morphology, which normally makes use of an Item-and-Process approach.
         以Lexeme語彙,語義為基礎的研究法。
         Lexeme = an abstract unit of morphological analysis in linguistics。如英文「唱歌」是同一個語彙lexeme的五個形式singing, sing, sings, sang, sung; 而這八個字詞am, is, are, was, were, be, being, been也是同一個語彙lexeme。
         (語彙(註) = 在語言學裡一個字形學分析用的抽象單位; 它是在忽略了word詞的不同發音及書寫形式下的同一個語意的單位)
     Word-based morphology, which normally makes use of a Word-and-Paradigm approach.
         以word字詞為基礎的研究法。
         word = a unit of language that carries meaning and consists of one or more morphemes which are linked more or less tightly together。
         (字詞 = 語文的一個單位, 它負載意義和包含一或多個具有或多或少緊密連繫的詞素; 它是語意兼形式上的書寫單位)
         (像這個網頁闡述了各種類的word : http://www.sussex.ac.uk/linguist ... what_is_a_word.pdf)
     以上三者morpheme, lexeme, word全是基於一些假設assumption及假說hypothesis而建立的理論, 在西方學術界仍在爭論中。我們的音魔餘孽殘種卻照搬來用得不亦樂乎, 以為找到一勞永日、世界最原初的、最根本的聖經; 有了它宇宙便得救贖了。(像猶太人找到亞衛YHWH獨神(其實是迦南地, 即今巴勒斯坦, 所信奉的土地神被擴充後再吸收其他神衹特性而成)、歐洲人找到了耶和華Jehowah獨神(其實是YHWH的歐洲版本), 阿拉伯人找到阿拉Allah獨神(其實是Jehowah和YHWH混合的阿拉伯版本))

  對於以詞素morpheme為基礎的字形學
  http://en.wikipedia.org/wiki/Morpheme-based_morphology
  Morpheme-based morphology is a view on morphology with the following three basic axioms:
  詞素基礎字形學是字形學裡用以下三種基本公理為基礎的一個觀點:
  (axiom=被認為自明之理self-evident; 就如獨神上帝的存在, 在西方是被認為是self-evident一樣。)
  1. Baudoin’s SINGLE MORPHEME HYPOTHESIS: Roots and affixes have the same status in the theory, they are MORPHEMES.
     Baudoin的單一詞素假設: 在這理論字根和綴詞有相同的狀況, 它們是詞素。
  2. Bloomfield’s SIGN BASE MORPHEME HYPOTHESIS: As morphemes, they are dualistic signs, since they have both (phonological) form and meaning.
     Bloomfield的標誌基礎詞素假設: 作為詞素, 它們是二元標誌, 因為它們都具有音韻學形式和意義。
  3. Bloomfield’s LEXICAL MORPHEME HYPOTHESIS: The morphemes, affixes and roots alike, are stored in the lexicon.
     Bloomfield的語彙詞素假說: 詞素, 綴詞和字根同樣地, 是存於語彙內。
  Morpheme-based morphology comes in two flavours, one Bloomfieldian and one Hockettian.
  詞素基礎字形學可歸類成兩派, Bloomfieldian 和 Hockettian.
  For Bloomfield, the morpheme was the minimal form with meaning, but it was not meaning itself. Rather, it was part of a larger structure.
  Bloomfield派認為詞素是意義的最小形式, 但其本身卻不是意義, 而是屬於一個更大的意義結構內的一部份。
  For Hockett, morphemes are meaning elements, not form elements. For him, there is a morpheme plural, with the allomorphs -s, -en, -ren etc.
  Hockett派認為詞素是意義的單元, 不是形式單元。詞素可有-s, -en, -ren等的複數。
  後來的其他派則是上述兩派的混合。
\-----
    對於詞素這個假設概念, 在西方只是用作字形研究, 而漢改人剽竊西人觀念後轉用作詞義
研究, 是抄襲來又不尊重原著的最卑劣行徑。在中国, 所謂詞素語素仍有爭議, 在西方,由
上所見, 爭議更多。
   漢改人像溺水小兒, 不管甚麼, 拿來主義下, 抓了便用; 饑不擇食下, 抓了便吃。(便有方便
, 也有大與小之別。)
4汉语和汉字的表义功能
  關認為的「汉字传递方式   字形[无音笔画]------无规律定音------以音定义」, 這
  是不正確的, 漢字不是音符, 所以不是以音定義的。自然, 不是關宗靈假想中的「还有一条
  以形表义的信息通道,以弥补字音信息的不足。」

四  关于同音字和同形字的分化
  關樓主對同音字的處理建議如下:
1 同音字的分化
例如 “ji”这个音节,读第一声的字有30多个,汉语电脑文字可分化如下:
芨jiac  矶jiat  畿jiaq  基jiaj  期jias  激jiaz
犄jibj  鸡jibq  肌jibr  跻jibz
嵇jica  姬jicf  赍jict  击jicu  讥jicy
玑jidc  稽jidd  屐jidf  积jidj  圾jidl  缉jidq 饥jidt  齑jidu  乩jidv
羁jiea  剞jiee  机jiej  几jieq  箕jier  畸jiet  叽jiey  唧jiez
奇jifu
2 同形字的分化
例如 “行”字   
行走的 “行”    汉语电脑文字的写法是: xghz
你真行的 “行”  汉语电脑文字的写法是: xgic            
行不行的 “行”  汉语电脑文字的写法是: xglk
银行的 “行”    汉语电脑文字的写法是: hcjm
=> 上面的密碼字, 若作為電腦中文輸入法則另當別論, 若真作為中文取代漢字, 是大錯特錯的
。首先文化及社會政治歷史等等的非文字研究範圍內所可看到的負面影響難以評估, 就是光
  就文字本身而言, 也等同把中文弱化成一維的密碼組合背頌, 比認形的二維圖形辨識更為困
  難。這是由腦科學認知科學研究中可確定的。我們的未來主人翁必須學習記憶ji音下: ac是
' 芨, at是磯, aq是畿, aj是基, as是期, az是激, bj是犄, bq是雞, br是肌, bz是躋, ca是
  嵇, cf是姬, ct是賫, cu是擊, cy譏是, dc是璣, dd是稽, df是屐, dj是積, dl是圾, dq是
  緝, dt是饑, du是齏, dv是乩, ea是羈, ee昃剞, ej是機, eq是幾, er是箕, et是畸, ey是
  嘰(關在這裡錯打成:「叽」了, 二維的儿和几也分不清, 更可況是只是一字母之差的拼音文
  ?), ez  是唧, fu是奇。還有xg之下, 記hz是行走, ic是真行, lk是行不行, 又有hc之下有
  銀行。
  二維的差異比起一維的差異是更適於辨識更有助於記憶的。上面那樣, 以兩字母代各式不同
  的漢字的記法, 兩字母差異和整個漢字二維差異, 在辨識記憶上, 實在比不上。
  對於不同義項而有不同的音調的, 行字便突然變成了四個新拼音字, 記憶上, 算你省了hang
  音對行字, 竟多出要記的四倍於原來的, 這叫作科學?

五  汉语电脑文字的读识
  關的新文字是1. 按声韵得音, 2. 由调得正確發音及類, 3. 還要再由字义类字母指示意義
  範圍才能定出是哪個漢字的意義, 4. ,字义的顺序
  第一, 聲韻字母是雙拼式單一字母代表聲母韻母, 本來就是硬把一個原來的字母音(自然是
  西方語音原本用來代表的音)再套用作代表別的音, 跟「一」再用作代表「一十一」同樣狀
  況, 這種違反習慣的轉換已是降低辨識認知效率。這裡便有以違反習慣為重點的、重新調配
  的字母的表要背頌。
  第二, 調又用字母, 自然要先辨別所處之位為調位, 腦中又有一個死背好的表來指示對應。
  第三, 調符字母不只表調, 還兼表類別, 使其表達作用複雜化, 影響人的思維。
  第四, 類表中查得類別描述範圍, 還加思索, 到底我腦中所認知的意義中, 又有那個字是在
        這個類表所指的範違內的。
  第五, 由「六 汉语电脑文字的特征」所述, 這種文字的表義功能, 不只太依賴人腦的記憶
        , 還大量使人腦多重運作在查表。是一種消耗人腦能量於無意義的工作上。再科學規
        範(其實是指分類嚴謹性、細緻性、唯一的一一對應), 但不適於人腦! 這是把人腦當
        成機器, 把人的創造性完全壓抑。是一種斷絕文化香傳, 窒息人創造性的文字。

六 汉语电脑文字的特征
   誇口其詞的六大特徵, 廣告詞而已。因為是音符, 不能“声入心通”, 因為是密碼組合,
   沒有所謂形, 如何能“形入心通”?
   作者所謂「只要记住声母,韵母,声调/字义类别字母,字义字母,根据所用字的音和义,
   就会拼写出其字来。」是由漢字入其拼音文, 真由腦中義而出字, 是難的, 而且可做到的
   人, 已經不是人了。
   看看作者自己的評語: 「它是中西文化碰撞的革命成果,是中华文化在信息时代发出的强
   音,是古为今用,洋为中用的典范。”」, 又是搬出文革妄撞的心念、口號, 作者是在搞
   破的革命, 能否立新, 又能否立個好新, 只有天知道!

七  展望。
   這裡的統計「根据资料统计,一段137个汉字的短文,翻译成英语需465个字母,翻译成德
   语需522个字母,翻译成法语约需597个字母,而汉语电脑文字仅380多个字母,」, 其拼音
   文要380個字母, 就是380個位元組(字節), 是電腦內佔用空間也是正比於傳輸時間, 中文字
   只有137個, 也即是274個字節, 平白地, 其拼音文要多出了: (380-274)/274 = 106/274 =
   38%的佔用空間及傳輸時間成本! 這叫作比原本的漢字好? 這叫作科學? 依漢改人觀念, 在
   電腦時代, 一種文字在電腦裡的運作時間及儲存成本高的話, 這種文字還怎有競爭的前途?

[ 本帖最后由 abcxyz1 于 2007-06-27 22:10:00 编辑 ]
您需要登錄後才可以回帖 登錄 | 入住家園

本版積分規則

手機版|小黑屋|吳語書院

GMT+8, 2026-9-4 17:51 , Processed in 0.027775 second(s), 12 queries .

Powered by Discuz! X3.5

© 2001-2026 Discuz! Team.

快速回復 返回頂部 返回列表