中文

在上下文感知神经机器翻译中提升目标数据的作用

计算与语言 2024-02-12 v1

摘要

标准的上下文感知神经机器翻译(NMT)通常依赖于文档级平行数据,同时利用源端和目标端上下文。特别是基于拼接的方法,作为文档级 NMT 的一个强基线,将源端和/或目标端上下文句子前置于待翻译句子之前,其中在两侧利用等量源数据和目标数据的模型变体取得了 SOTA 结果。在这项工作中,我们研究了是否应在标准基于拼接的方法中进一步提升目标数据的作用,因为大多数文档级现象依赖于目标语言侧存在的信息。我们评估了新颖的基于拼接的变体,其中目标上下文被前置于源语言之前,可以是单独前置,也可以是与源上下文结合前置。在英语-俄语和巴斯克语-西班牙语上的实验结果表明,在源端包含目标上下文在目标语言现象上带来了巨大提升。在源依赖现象上,仅在源端使用目标语言上下文即可与 SOTA 拼接方法持平或略逊一筹,而在源端结合源上下文和目标上下文则带来了全面的显著提升。

关键词

引用

@article{arxiv.2402.06342,
  title  = {Promoting Target Data in Context-aware Neural Machine Translation},
  author = {Harritxu Gete and Thierry Etchegoyhen},
  journal= {arXiv preprint arXiv:2402.06342},
  year   = {2024}
}