中文

机器翻译中正字法信息研究综述

计算与语言 2021-06-09 v1

摘要

机器翻译是自然语言处理的应用之一,已在多种语言中得到探索。近来,研究者开始关注资源贫乏语言及亲缘语言的机器翻译。这类机器翻译系统存在一个普遍而深层的问题,即正字法约定上的差异,这给传统方法带来诸多困难。以两种不同正字法书写的语言不易比较,但正字法信息亦可用于改进机器翻译系统。本文综述了关于正字法对资源不足语言机器翻译影响的研究,从机器翻译角度介绍资源不足语言,以及正字法信息如何被用于改进机器翻译。我们描述了该领域的已有工作,讨论其所基于的假设,并展示正字法知识如何提升资源不足语言机器翻译的性能。我们讨论了不同类型的机器翻译,并指出近期将正字法信息与成熟机器翻译方法相联系的趋势。本文着重关注在机器翻译不同层面上利用同源词信息的现有努力及其可汲取的经验。此外,本综述特别聚焦于亲缘语言的多语言神经机器翻译。文章最后讨论了借助正字法信息推进机器翻译的路径,重点关注多语言场景与双语词典抽取。

关键词

引用

@article{arxiv.2008.01391,
  title  = {A Survey of Orthographic Information in Machine Translation},
  author = {Bharathi Raja Chakravarthi and Priya Rani and Mihael Arcan and John P. McCrae},
  journal= {arXiv preprint arXiv:2008.01391},
  year   = {2021}
}

备注

18 pages