X-ALMA:面向大规模翻译的即插即用模块与自适应拒绝
计算与语言
2025-03-04 v2
摘要
大型语言模型(LLMs)在各类 NLP 任务中取得了显著进展,尽管其在英文任务上表现突出,但由于以英文为中心的预训练和有限的多语言数据,模型常在中低资源语言上表现不足,导致性能严重偏向高资源语言。本文聚焦翻译问题,针对50种语言(无论资源水平如何)的翻译性能不均衡现象,我们提出 **X-ALMA** 模型,旨在确保所有语言都能获得顶级翻译质量。根据 COMET-22 指标,X-ALMA 在 FLORES-200 和 WMT'23 测试数据集上的所有翻译方向上均优于 Aya-101 和 Aya-23 等最新开源多语言 LLM。这一成果得益于即插即用语言特定模块架构防止训练期间的语言冲突,以及精心设计的训练方案和 novel 优化方法以最大化翻译性能。最终训练阶段,我们提出的 **A**daptive **R**ejection **P**reference **O**ptimization (**ARPO**) 在翻译任务中超越了现有的偏好优化方法。
引用
@article{arxiv.2410.03115,
title = {X-ALMA: Plug & Play Modules and Adaptive Rejection for Quality Translation at Scale},
author = {Haoran Xu and Kenton Murray and Philipp Koehn and Hieu Hoang and Akiko Eriguchi and Huda Khayrallah},
journal= {arXiv preprint arXiv:2410.03115},
year = {2025}
}
备注
Published as a conference paper at ICLR 2025 (spotlight)