中文

当好译文在上下文中出错时:上下文感知机器翻译在指代、省略与词汇衔接上的改进

计算与语言 2019-06-10 v2

摘要

尽管长期以来人们已认识到缺乏句外上下文会导致机器翻译错误,但上下文感知 NMT 系统的开发受到若干问题的阻碍。首先,标准度量对文档级翻译一致性改进的敏感度不足。其次,先前关于上下文感知 NMT 的工作假设句对齐的平行数据由完整文档组成,而在大多数实际场景中,此类文档级数据仅占可用平行数据的一小部分。针对第一个问题,我们在一个英俄字幕数据集上进行了人工研究,并确定指代、省略和词汇衔接为不一致的三大主要来源。随后我们创建了针对这些现象的测试集。针对第二个不足,我们考虑这样一种设置:与文档级对齐的数据相比,有更大量的句子级数据可用。我们引入了一种适用于该场景的模型,并在我们的新基准上展示了相比上下文无关基线的主要提升,且不牺牲以 BLEU 衡量的性能。

关键词

引用

@article{arxiv.1905.05979,
  title  = {When a Good Translation is Wrong in Context: Context-Aware Machine Translation Improves on Deixis, Ellipsis, and Lexical Cohesion},
  author = {Elena Voita and Rico Sennrich and Ivan Titov},
  journal= {arXiv preprint arXiv:1905.05979},
  year   = {2019}
}

备注

ACL 2019 (camera-ready)