中文

利用相关资源丰富语言改进资源匮乏语言的统计机器翻译

计算与语言 2014-01-28 v1

摘要

我们提出了一种新颖的语言无关方法,通过利用资源匮乏语言与资源丰富语言的相似性来改进前者的机器翻译。更具体地说,给定包含有限数量平行句对的资源匮乏源语言X1X_1到资源丰富语言YY的双语文本,以及某种与X1X_1密切相关的资源丰富语言X2X_2YY的更大规模双语文本,我们改进了从X1X_1YY的翻译。这是通过利用X1X_1X2X_2在词汇重叠以及拼写、词序和句法上的相似性所提供的机会来实现的:(1) 我们改进了资源匮乏语言的词对齐;(2) 我们进一步用额外的翻译选项对其进行增强;(3) 我们通过适当的音译处理潜在的拼写差异。使用马来语进行印尼语到英语的评估,以及使用葡萄牙语并假装西班牙语为资源匮乏语言进行西班牙语到英语的评估,分别显示了高达 1.35 和 3.37 BLEU 点的绝对增益,这优于最佳的竞争方法,同时使用了更少的额外数据。总体而言,我们的方法将所需的“真实”训练数据量减少了 2 到 5 倍。

关键词

引用

@article{arxiv.1401.6876,
  title  = {Improving Statistical Machine Translation for a Resource-Poor Language Using Related Resource-Rich Languages},
  author = {Preslav Ivanov Nakov and Hwee Tou Ng},
  journal= {arXiv preprint arXiv:1401.6876},
  year   = {2014}
}