论语言特征在统计与神经机器翻译中的整合
计算与语言
2020-04-01 v1 人工智能
摘要
新的机器翻译(MT)技术正在迅速涌现,随之而来的是诸如以下的大胆人类 parity 声明:(i) 所产生的结果接近“普通双语人类译员达到的准确性”(Wu et al., 2017b),或 (ii) “与专业人类译员相比翻译质量达到人类 parity”(Hassan et al., 2018)已见诸报道(Laubli et al., 2018)。除了许多此类论文自行定义人类 parity 这一事实外,这些耸人听闻的声明往往缺乏对所有翻译相关方面的完整分析。确立统计机器翻译方法的优势与人类翻译方式之间的差距是我们研究的起点。通过考察机器翻译输出与语言学理论,我们得以识别一些遗留问题。这些问题从简单的数和性一致错误,到更复杂的诸如体值与时态的正确翻译等现象。我们的实验与其他研究(Bentivogli et al., 2016)一致,证实神经机器翻译已在许多方面超越统计机器翻译。然而,一些问题仍然存在,另一些问题已经出现。我们涵盖了一系列与特定语言特征整合进统计和神经机器翻译相关的问题,旨在分析其中部分问题并提供解决方案。我们的工作聚焦于围绕语言学与机器翻译之间普遍复杂关系的三个主要研究问题。我们识别出自动翻译系统为产出更准确译文所缺失的语言信息,并将额外特征整合进现有流水线。我们识别出过度泛化或“算法偏差”作为神经机器翻译的潜在缺陷,并将其与许多遗留的语言学问题联系起来。
引用
@article{arxiv.2003.14324,
title = {On the Integration of LinguisticFeatures into Statistical and Neural Machine Translation},
author = {Eva Vanmassenhove},
journal= {arXiv preprint arXiv:2003.14324},
year = {2020}
}