中文

学会记忆:具有循环记忆的 Transformer 用于文档级机器翻译

人工智能 2022-10-21 v1

摘要

Transformer 架构在机器翻译中带来了显著增益。然而,大多数研究仅关注句子级翻译,未考虑文档内的上下文依赖,导致文档级连贯性不足。一些近期研究试图通过引入额外的上下文编码器或使用多句甚至整篇文档翻译来缓解此问题。此类方法可能丢失目标端信息,或随文档变长而增加计算复杂度。为解决这些问题,我们在原始 Transformer 中引入循环记忆单元,支持句子与先前上下文之间的信息交换。该记忆单元通过从句子获取信息并递归更新,将聚合知识传回后续句子状态。我们采用两阶段训练策略,模型先在句子级训练,再微调用于文档级翻译。我们在三个流行的文档级机器翻译数据集上实验,模型较句子级基线平均提升 0.91 s-BLEU。我们还在 TED 和 News 上取得最先进结果,较先前工作平均分别高出 0.36 s-BLEU 和 1.49 d-BLEU。

关键词

引用

@article{arxiv.2205.01546,
  title  = {Learn To Remember: Transformer with Recurrent Memory for Document-Level Machine Translation},
  author = {Yukun Feng and Feng Li and Ziang Song and Boyuan Zheng and Philipp Koehn},
  journal= {arXiv preprint arXiv:2205.01546},
  year   = {2022}
}

备注

Accepted by NAACL-2022 Findings