找回密碼
 入住家園
查看: 1111|回復: 4

【原创】浅述机器翻译发展

[複製鏈接]
發表於 2006-6-21 20:18:02 | 顯示全部樓層 |閱讀模式
机器翻译是计算语言学这门学科发展以来在自然语言处理这方面较热门的话题,也是一直困扰计算语言学家们的中心问题,虽然是热门话题,但对于机器翻译这个项目的研究已不是什么新鲜问题。在20世纪40年代以来,几乎跟数字电子计算机的问世同步,人们便幻想着用计算机处理自然语言了,而这也是最引人注意的领域。
机器翻译是个充满着人类梦想的研究领域,机器翻译的研究水平的提高为我国引进外国的技术,引进国外的各领域的研究成果和一些涉外的文本处理提供了理想的手段,也是世界各国科技文化交流走向更加深入的必要的手段。在此,笔者结合世界和中国对机器翻译研究的发展总结出了以下机器翻译研究发展的几个阶段:
一、开创期:(1946~1954)
在开创期,最具有标志性意义的有两件事:一是信息论的先驱WarrenWeaver发表了有关机器翻译的备忘录,提出了机器翻译的可能性;二是1954年美国Georgetown大学在IBM的协同下,进行的英俄翻译实验,开始了在翻译自动化方面的尝试。而中国开始这项研究并不晚,早在1956年,国家就把这项研究列入了全国科学工作发展规划,课题名称是“机器翻译、自然语言翻译规则的建设和自然语言的数学理论”。在1957年正式启动这项研究,1959年我国宣布了俄汉机器翻译试验成功。我国迎来机器翻译的萌芽发展阶段。而世界上再机器翻译这个领域也被笼罩在乐观的氛围之中,人们乐观的人为机器翻译在不久的时间内可以完美的解决,各国政府也对其进行了较大的支持。这个阶段机器翻译虽然处于开创阶段,但已经进入了乐观的繁荣期。
二、受挫期:(1954~1975)
最典型的事件是美国的语言自动处理咨询委员会(ALPAC)对各类机器翻译系统进行了评估,公布了著名的APLAC报告,给了那些搞机器翻译者们着实破了一盆冰冷的凉水。报告全面否定了机器翻译的可行性,并建议停止对该项目的资金支持。无独有偶,中国爆发了“十年文革”基本上这些研究也停滞了。而世界在这之后,机器翻译进入了萧条的阶段。但从现在看来,美国的这个报告显得过于武断,片面。
三、恢复期:(1975~1989)
促使机器翻译这项事业复出的是微型处理器的出现和对自然语言的更加深入地描写。中国结束了“十年浩劫”后重新振作起来,机器翻译这项工程也随之被提上了日程。而且取得了不少可人的成果。
四、新时期:(1990~现在)
机器翻译成为了几句烫手的山芋,INTERNET和个人电脑(PC)的普及,使得机器翻译有了广阔的发展平台。国际性的关于机器翻译研究的会议频繁召开,中国也取得了前所未有的成就,我国开发了多款翻译软件,但和国外相比我们虽然有了巨大的进步,差距还是显而易见的。
机器翻译走过了这么多年,有萎靡也有高潮,其中机器翻译的方法在此过程中有了十足的进步,下面我们看一看这些关于机器翻译的方法。
关于机器翻译的方法,大致我们可以分为两大范畴,一类范畴是“经验主义”的方法范畴,与之相对的一类范畴是“理性主义”的方法范畴。前者所谓“经验主义”的方法范畴指的是以大规模语料库的分析为基础的方法,又称为基于语料(Corpus–Based)的方法,分为基于统计(Statistics–Based)和基于实例(Example–Based)两种方法,而后者指的是以生成语言学为基础的方法,也称为基于规则(Ruler–Based)的方法,这是传统的也是一直占主导地位的机器翻译方法, 可分为基于转换(Transfer–Based)和基于中间语言(Interlingua–Based)两种方法。
首先,让我们来看看基于规则的方法。其实以乔姆斯基的转换生成语法为理论基础的,现在基于规则的机器翻译方法使机器翻译研究的主流。这种方法通过人工或机器辅助,先构造供翻译用的词语信息库和句法语义规则库,通过知识表示、知识推理、分析生成等步骤来进行机器翻译、经验主义方法的特点是较少对源语言和目标语言进行分析,而是直接在词串上进行处理。
其次,再来说说给予语料的方法,如上所述,其还可分为基于统计和基于实例的方法。前者必须要建一个相当规模的语料库。其基本思想是把机器翻译看成是一个信息传输的过程,用一种信道模型对机器翻译进行解码。采用隐马尔可夫模型(HMM),这种模型在词性标注上效果显著。后者的基本思想是不通过深层的分析,仅通过已有的经验知识,通过类比原理进行翻译。后者的研究潜力很大,成为近几年来机器翻译研究的热点。
这两种方法虽说各成一家,但是没有哪一种是单纯的应用于机器翻译当中的,于是便出现了两种方法相融合的现象。如,基于模版的机器翻译方法,这种方法就是集合了基于规则和基于语料库的两种方法的优点。还有一种基于有限状态自动机(FSA)的机器翻译方法,这是一种较成熟的方法。为了提高基于模版的翻译方法的翻译质量又出现了多引擎的机器翻译方法。
虽然有了上述机器翻译的诸多方法,但是机器翻译仍然是一个不够完善和令人满意的学科,真正的机器翻译还是人们渴望的理想。为什么会出现这种情况呢?这里认为主要是机器翻译存在着以下的局限:
大的问题,也是其根本问题,就是语言是人类的思维工具,具有动态性的特征。人类所发出的语言是在特定的语境下,包括人自身的因素,当时的环境,场合,说话对象,自身需要等条件的限制,可能语言具有了普遍语言内核中不具备的意义。如,反语,谚语,歧义等现象,这些都是自由的,而机器是不能和人一样作出不同形式的思维的,它只能是词典中的含义的体现。这种超语言的因素是人们乃至整个民族的精神内核,在这种情况下,机器翻译就显得捉襟见肘了。
这种根本的局限表现在机器翻译中可以概括为以下几个方面:
一、多义性识别上的困难
多义性指的是人们交际中所发出的信息在不同的语境下可以表现出多种不同的意义。这是机器翻译要解决的最基本的,也是最难解决的一个问题。如,
今天是星期六
对丈夫说,可能表示提醒
孩子对父母说,可能表示这个孩子想放松,想要出去玩。
老板对打工者说,可能表示今天上班算加班。
从疲劳过度的学生口中说出来,可能表示今天向睡个懒觉。
以上所局还可能有更多的例子,但是单单是这些就已经可让机器爆掉了。机器只能翻译出来的只有一句这样的话“今天是星期六”而语言中深层的多一行是不能在机器翻译中得到体现的。
二、歧义的辨别能力差
这里主要指的是因结构产生的歧义,我们还是那这个著名的例子来举例“咬死了猎人的狗”来进行说明。这是个有歧义的词组,我们可以认为“一只狗咬死了猎人”,还可以认为“是某些猛兽咬死了猎人的狗”。人在处理这些语言片断时,是可以消除其歧义的,但是如果换了机器就很是困难了,虽然在现代机器翻译研究中正在努力解决像这样的问题,但结果总是不够令人满意的。
三、文化领域上的特殊性,机器翻译表现出来的困难
这种困难的产生是由于源语言和目标语言所在国家的文化信仰的不同导致机器翻译在处理语言上的困难。例如,关于亲属词,就拿英语和汉语作比较,英语中不管是弟弟还是哥哥,还是什么堂兄或堂弟,都称为“brother”由汉语翻译成英语还好,但是若由英语翻译成汉语就是有些困难了。还有中国中的岳父、岳母也可以称作爸、妈。汉对英的机器翻译就会遇到麻烦的。
面对上述种种机器翻译带来的困难,研究人员都在进行着艰难的攻关战。也有了一定的成果,但如果要通过机器翻译获得高质量的论文则需要以后很长时间的科学家们的探索,目前一些机器翻译所采用的主要策略有:
一、在限定的领域内进行翻译
这种方法也可以成为是“子语言法”,这种方法只希望在狭隘有限的领域获得高质量的译文。实际上,现在许多翻译系统属于这个这一类型。这种方法已经取得了良好的成果。
二、利用受限语言作为输入
这种方法是通过对输入的机器的文本中的词汇和句法结构的限制来达到理想的翻译效果。
三、人机交互式机器翻译
其基本思想是在机器翻译遇到困难时,通过人为的干涉来获得理想的译文。但这我觉得总不能算是机器翻译。
在这里,我不敢妄谈什么机器翻译的困难的对策。于我自己的观点,在这里介绍一些小的想法:
一、引入塞林克的“中介语”假说
这是一种动态的语言的“近似系统”(纳姆瑟),我认为,它可以指导基于实例的机器翻译中的目标语言和源语言实例进行对齐。可以这样设想,我们可将目标语言和源语言同时与一个中间模块来对齐。这种模块并不是什么语言,而是一种基于中间状态的语言片断。这些模块是一种语料库——一种人们学习外语中的所产生“中介语”现象精加工后的集合。在这个语料库重视严整的语言片断,它具有处于两种语言中间地带的模糊性的特点。或许我们可以叫做机器翻译中的“洋泾浜”。这种基于“中介语”的对齐应该是很好进行的。从一定的程度上,可能使机器翻译的水平提高。但这只是我的一个想法。
二、加强对分词技术、词性标注、词义标注的研究。
这里主张进行对自然语言进行深一层的具体的描写。我们主张将语言抽象化,将语言抽象成一个个的客观的符号,对其意义不加以描述,只是用客观的描写。或许可以以语义为基础将符号描写成某种变体,就像因为描写一样。比如说,“快”有多个义项,将“快”本身抽象成一个与意义和思维毫无关联的符号,将在不同语境的多个义项设成其变体,进行组合。当然这是基于条件的。或许丹麦的哥本哈根学派的语言主张会对我们会有所启示。
三、增强语料库功能,开放语料库,实现语料库共享。
我们可以将语料库分为各个小的子语料库,比如将小的子语料库分为政治、军事、经济、科技等等。在按照特定的语言对译进行归类。这看起来是个大项目,但是联合协作,个个语料库相互对外开放是有可能实现的。这种开放的语料库对机器翻译中的语料库的建设有益的。
以上简单的提到了关于机器翻译的发展、现状、困难、及对策,其中也有些自己的想法,也许不太合适。但总之我们要对机器翻译应该抱有希望,在以后的信息处理,微电子技术的发展,以及相关的如,认知心理学,语言学,哲学,文化研究等学科的发展,机器翻译获得全面的成功是有可能的,但必须认识到,这要经过几代人的努力!
發表於 2006-6-21 21:34:25 | 顯示全部樓層
想问楼主老大,你是从事机器翻译行业的吗?

金蝶?
 樓主| 發表於 2006-6-22 00:36:08 | 顯示全部樓層
不是,我看了一本关于这个方面的书,写着玩的。
發表於 2006-6-22 15:35:43 | 顯示全部樓層
引用第2楼andylly2006-06-22 00:36发表的“”:
不是,我看了一本关于这个方面的书,写着玩的。
你应该找这里的zzjjj一同探讨,他以前搞过
 樓主| 發表於 2006-6-23 18:12:22 | 顯示全部樓層
谢谢,我会找他谈的。
您需要登錄後才可以回帖 登錄 | 入住家園

本版積分規則

手機版|小黑屋|吳語書院

GMT+8, 2026-9-4 15:53 , Processed in 0.023579 second(s), 16 queries .

Powered by Discuz! X3.5

© 2001-2026 Discuz! Team.

快速回復 返回頂部 返回列表