中文

面向多语言神经机器翻译模型的长上下文能力诱导

计算与语言 2025-02-11 v3

摘要

神经机器翻译(NMT)模型传统上使用正弦位置编码(PE),其往往难以捕捉长程依赖关系,且在处理扩展上下文或文档级翻译任务时效率低下。本研究旨在解决将预训练 NMT 模型从绝对正弦位置编码迁移至相对位置编码(如 RoPE 和 ALiBi)这一挑战,同时不损害模型性能。我们证明,仅使用少量高质量数据进行的参数高效微调即可成功实现这一转换。实验结果表明,从正弦位置编码切换至相对位置编码后,在句子级评估基准上取得了具有竞争力的翻译质量。此外,在文档级基准上,使用 RoPE 训练的模型在基于字符串的指标和定性评估中始终优于使用 ALiBi 和正弦位置编码的模型。此外,我们发现少数语言中少量长上下文数据足以实现跨语言长度泛化,从而诱导长上下文能力。

关键词

引用

@article{arxiv.2408.11382,
  title  = {Towards Inducing Long-Context Abilities in Multilingual Neural Machine Translation Models},
  author = {Varun Gumma and Pranjal A. Chitale and Kalika Bali},
  journal= {arXiv preprint arXiv:2408.11382},
  year   = {2025}
}

备注

Accepted at NAACL 2025