找回密碼
 入住家園
查看: 859|回復: 11

【原创】从汉字在电脑的内存说起,结果更可怕

[複製鏈接]
發表於 2005-12-4 15:51:50 | 顯示全部樓層 |閱讀模式
从汉字在电脑的内存说起,不论是英文还是汉字,电脑存储的都是字符的机内码。也就是假设我们真的能到电脑内部看看的,那是看不到汉字或英文的,只是一些二进制码。比方说“汉字”这两个字在内存是1011 1010 1011 1010( 汉) 1101 0111 1101 0110(字)就是汉字的机内码:ba ba d7 d6(二进制码之间是没有空格的为了看我加上的)也就是每个汉字都有一个对应的16比特的二进制码。很显然6763个汉字就是需要6763机内码。英文只有26个就可以了。
  为了说明问题,我们假设汉字已经扩展到一百万零6000个,并且一百万个汉字已经成为死字也就是不用了,只用6000个汉字,摆在我们面前的问题是:我们那时所用的6000个汉字,能不能用从一到六千的机内码给活着的汉字编码。不能,绝对不能。我们只能在一百万的基础上对活着的汉字进行编码。比方说活着的汉字正好是一百万零一开始到一百万零六千。那么那时我们的第一个汉字的编码应该是1000001最后一个汉字的机内码就是1006000。
  可能有的人要问为什么不能从一开始,很简单若是从一开始,我们以前存储汉字码是从1~1000000,今天再从一开始那不就是我们存在磁盘的历史文献,全部没了吗。
  假若活着的汉字不是从一百万零一开始的那他的机内码就会七长八短了。但是不管长或短码必须一边长,就是把短码扩到和长码一样长,否则电脑无法处理。
  就是汉字发展到一亿,也不能从一开始编码。可是英文就不存在这个问题,旧词死掉,新词诞生。26个英文字母的机内码不用变,还是26个。全球每台电脑都不会有一点点麻烦。汉字只要增加一个字,全球使用汉字系统的每一台电脑都必须跟着增加一个汉字,在增加汉字的同时,还要更换汉字系统(原因自酌)否则他就不会显示出那个汉字。这就是牵一发而动全球的原理。
  综上所述,汉字在电脑中的编码不能吐故纳新,是一个只能增加的文字系统,最后最后的结果是什么。设想已经到10亿,20亿我们每一个汉字的编码就要用10亿或20亿,对,必然是这样。(活字不可能是10亿或20亿,也许只有几百个)。谁也不能保证我们所用的汉字永远也不会增加了。最近国家就公布了新造的五个汉字吧。社会越发达,新造字可能越多。
  一个不能进行新陈代谢的机体或系统。只能随着增加而老化,老化就是趋向死亡。发展越快死的也越快!
  我们应该细细思考,到底谁在保卫汉字。

[ 本帖最后由 汤光大 于 2005-12-04 16:16:38 编辑 ]
發表於 2005-12-4 18:52:38 | 顯示全部樓層
楼主是小白
     ——鉴定完毕
 樓主| 發表於 2005-12-6 15:17:03 | 顯示全部樓層
原文由 fhb13 发表:
楼主是小白
     ——鉴定完毕
请你赐教能否详细说说鉴定,白在那里,恭候指点,以便改进和提高。
發表於 2005-12-6 16:03:41 | 顯示全部樓層
建议新电脑所有指令和字符都为2各字节,而且编码统一,这样会很大程度上解决乱码问题
發表於 2005-12-6 18:45:20 | 顯示全部樓層
“小白”是在骂谁呢?不明白。。。
發表於 2005-12-7 23:45:02 | 顯示全部樓層
原文由 大地的旋律 发表:
建议新电脑所有指令和字符都为2各字节,而且编码统一,这样会很大程度上解决乱码问题

不太可能,中国的国粹主义者现在很得宠,不把七八万汉字装到联码里誓不罢休,以后汉字的每个字符都为4个字节,就不知道老外年复一年地这么做赔本交易受得了受不了。
 樓主| 發表於 2005-12-8 14:29:22 | 顯示全部樓層
原文由 大地的旋律 发表:
建议新电脑所有指令和字符都为2各字节,而且编码统一,这样会很大程度上解决乱码问题
首先说电脑的字节的八个比特位,不是人为的约定,而是硬件限定的,当初的数据总线只有八根,当然也不是随便定的八根。与这八根总线有关的记忆存储方法以及各种磁盘读写,内存的管理,信息的加工传递技术方法,协议等各种技术领域的代码相继诞生,相应的工业技术和生产线也日趋完整。后来的DOS流行于世界怎么多年。就无法改变了。这也和存储的方法密切相关的,也就若是今天一改,过去的一切存储资料和相应的技术以及电脑所处理的各个领域的资料全是废物,也就是人类的历史出现了空白。所以尽管如今的电脑内部总线多到32也好64也好甚至更多,总线位数的增加是一个了不起的科技进步,也就是不是人们想要增加就会增加的。不管数据总线怎样增加也是无法改变电脑编程的数据流是一个字节的八个比特位了。只好永远如此了。再说八个比特位的约定对现在和将来都没有任何影响(就是不适合汉字),

[ 本帖最后由 汤光大 于 2005-12-08 20:03:39 编辑 ]
發表於 2005-12-8 15:06:36 | 顯示全部樓層
由于历史的原因,导致了今天这个“万码奔腾”的局面。其中最主要汉字编码标准有BIG5、ISO 10646、UNICODE、CJK、GB2312、GBK、GB13000、GB18030等等,再加上一些自造的编码,一时间让人们不知所措。

ISO 10646是国际编码标准,该标准旨在囊括世界上所有文种。CJK特指其中的中、日、韩统一编码的汉字部分。目前CJK由三部分构成:CJK 20902汉字、CJK Extension A 6582汉字和CJK Extension B 47211汉字。也就是说,到目前为止ISO 10646已编码汉字达七万字之多。

WINDOWS 95的内核已经Unicode化,正是由于这一点,WINDOWS 95上所有GBK字库都可以完全不加修改地作为Unicode字库用于WINDOWS NT平台;只要将WINDOWS 95上输入法码表存成Unicode形式,就可以用于WINDOWS NT平台。但它毕竟还是Code Page,它不是ISO 10646 “一码走遍天下”的体系结构。停留在GBK,或者去发展GB18030都是自寻死路,不可能实现SDSB全球化的数字化产品的开发。

请问汤先生:GB18030已通过并强制执行,汉字存储、传输等过程现在都是两字节,以后汉字编码集完全实现统一到ISO 10646的国际编码标准,汉字的存储应是两字节,传输过程就变成了四字节,按统一码长的原理,汉字和拉丁字母在机内码是同一概念的东西,拉丁字母和汉字也应按统一方式存储和传输,我的理解是否正确,望指教。
 樓主| 發表於 2005-12-8 17:35:27 | 顯示全部樓層
回复8楼 乘风破浪  
  说句实在话,我一直对无限扩大汉字库的字数不感兴趣,所以一直没有深入研究,只是浏览一些有关帖子;一些帖子说虽然英文的26个字母也是四个字节,只是一种标志,也就是传播和处理时仍然还是按一个字节处理的。
  不管怎么样。汉字存储的方式还是没有改变,就是字模加代码,字库越大代码越多,问题也就越多,不用和闲置在字库的汉字越多,假设常用的汉字3500不常用的就是70000-3500=66500相当20分之一,另外不管那一种字号都是70000个,若是有10种字号就是有66500X10=665000汉字空闲,可以形象一点说越大越难受,直至崩溃罢了。英文还是26个字母和代码。电脑越来越提高,汉字越来越累赘。英文越来就越快了。
  再说如果以后汉字有任何增加,都是全球的麻烦。
  再说统一码,只是商业动机,并没有帮助汉字有什么改进,就如同开饭店的老板一样,你越能吃越好,我就给你预备一个更大更大的碗。让你可劲吃,钱上找齐。因为全世界用汉字的人太多接近1/5,这实质这些电脑专家要把用汉字人的血汗和腰包的黄金掏空。网络是按传输的字节收非的。难道我们非得死到临头才明白吗。
  个人愚见只供参考。

[ 本帖最后由 汤光大 于 2006-02-09 14:21:12 编辑 ]
發表於 2005-12-9 17:28:57 | 顯示全部樓層
漢字編碼是個小問題,現在制約漢字編碼的是漢字不統一的問題.
您需要登錄後才可以回帖 登錄 | 入住家園

本版積分規則

手機版|小黑屋|吳語書院

GMT+8, 2026-9-4 22:38 , Processed in 0.024777 second(s), 15 queries .

Powered by Discuz! X3.5

© 2001-2026 Discuz! Team.

快速回復 返回頂部 返回列表