中文

改进解码器-only 架构在多语言神经机器翻译中的语言迁移能力

计算与语言 2024-12-04 v1

摘要

现有的多语言神经机器翻译 (MNMT) 方法主要致力于改进采用 encoder-decoder 架构的模型以实现多语言翻译。然而,由于 decoder-only 架构仅基于平行数据训练时表现不佳,其在 MNMT 中的探索相对较少。本文认为,decoder-only 架构的主要问题在于其缺乏语言迁移能力。具体而言,decoder-only 架构在对源标记进行编码时,难以充分利用目标语言特征。我们提出将解码过程分为两个阶段,以此在第一个阶段显式排除目标标记,从而在不同语言之间隐式提升迁移能力。此外,我们对翻译指令进行对比学习,显著提升零样本翻译性能。我们在 TED-19 和 OPUS-100 数据集上进行实验,考虑从头训练和微调两种情形。实验结果表明,与 encoder-decoder 架构相比,我们的方法不仅在监督翻译中表现具竞争力,还在零样本翻译中实现了最高可达 3.39 BLEU、6.99 chrF++、3.22 BERTScore 和 4.81 COMET 的提升。

关键词

引用

@article{arxiv.2412.02101,
  title  = {Improving Language Transfer Capability of Decoder-only Architecture in Multilingual Neural Machine Translation},
  author = {Zhi Qu and Yiran Wang and Chenchen Ding and Hideki Tanaka and Masao Utiyama and Taro Watanabe},
  journal= {arXiv preprint arXiv:2412.02101},
  year   = {2024}
}