中文

多语言神经机器翻译中源标记到目标语言空间的注册

计算与语言 2025-05-27 v3

摘要

多语言神经机器翻译(MNMT)旨在实现多个语言之间的任意翻译。虽然MNMT专用模型在平行数据上训练可实现训练和部署成本低廉,但其性能始终落后于大型语言模型(LLM)。本文提出了一种新方法,即注册(registering),使小型MNMT专用模型能够与LLM竞争。具体而言,我们在输入序列中插入一组指定目标语言的人工标记,称为注册标记(registers),置于源标记和目标标记之间。通过修改注意力掩码,目标标记的生成仅关注注册标记的激活,这些激活将源标记在目标语言空间中表示。实验在EC-40大规模基准测试上表明,我们的方法推动了MNMT的最新进展。我们进一步在来自公共语料库的24种语言、93亿句对中进行预训练,构建了两个模型,称为MITRE(multilingual translation with registers)。其中一个模型MITRE-913M在NLLB-3.3B上取得更好表现,性能与商业LLM相当,并在微调中表现出强大的适应性。最后,我们开源了我们的模型以促进MNMT的进一步研究与开发:https://github.com/zhiqu22/mitre。

关键词

引用

@article{arxiv.2501.02979,
  title  = {Registering Source Tokens to Target Language Spaces in Multilingual Neural Machine Translation},
  author = {Zhi Qu and Yiran Wang and Jiannan Mao and Chenchen Ding and Hideki Tanaka and Masao Utiyama and Taro Watanabe},
  journal= {arXiv preprint arXiv:2501.02979},
  year   = {2025}
}

备注

Accepted by ACL 2025 (main)