中文

利用协作学习整合多样化建模上下文以用于神经机器翻译

计算与语言 2024-02-29 v1

摘要

自回归 (AR) 和非自回归 (NAR) 模型是神经机器翻译 (NMT) 的两种生成模型。AR 模型以逐词方式预测 token,能够有效捕捉真实翻译的分布。NAR 模型通过提取双向上下文信息来预测 token,这可以提高推理速度,但它们 suffers from 性能下降。以往的工作利用 AR 模型通过降低训练数据的复杂性来增强 NAR 模型,或者借助 NAR 模型将全局信息纳入 AR 模型。然而,这些研究的方法仅利用了单一类型模型的上下文信息,而忽略了不同类型模型所能提供的上下文信息的多样性。在本文中,我们提出了一种新颖的通用协作学习方法 DCMCL,其中 AR 和 NAR 模型被视为协作者而非教师和学生。为了分层利用双边上下文信息,在 AR 和 NAR 模型之间采用了 token 级互学习和序列级对比学习。在四个广泛使用的基准测试上进行的大量实验表明,所提出的 DCMCL 方法可以同时提高 AR 和 NAR 模型的性能,BLEU 分数分别最高提升 1.38 和 2.98,并且在 AR 和 NAR 解码方面均能以最高 0.97 的 BLEU 分数超越当前最佳的统一模型。

关键词

引用

@article{arxiv.2402.18428,
  title  = {Leveraging Diverse Modeling Contexts with Collaborating Learning for Neural Machine Translation},
  author = {Yusheng Liao and Yanfeng Wang and Yu Wang},
  journal= {arXiv preprint arXiv:2402.18428},
  year   = {2024}
}

备注

12 pages, 6 figures