中文

MT-R1-Zero:基于 R1-Zero 强化学习的大语言模型机器翻译突破

计算与语言 2025-04-15 v1 人工智能 机器学习

摘要

大规模强化学习(RL)方法在提升大语言模型(LLM)推理能力方面取得显著成效,尤其适用于数学和编码等解决方案可验证的任务。然而,将其应用于机器翻译(MT),由于输出格式灵活且难以通过显式规则自动评估,仍鲜有探索。本文介绍 MT-R1-Zero,即首个无需监督微调或 cold-start 的 R1-Zero 强化学习框架在机器翻译中的开源适配方案。我们提出了一种规则-指标混合奖励机制,以引导大语言模型通过涌现推理实现翻译质量提升。在 WMT 24 英中基准上,MT-R1-Zero-3B-Mix 取得竞争性能,相较于 TowerInstruct-7B-v0.2 提升平均 1.26 分。同时,MT-R1-Zero-7B-Mix 在所有指标上取得 62.25 的高平均得分,与 GPT-4o 和 Claude-3.5-Sonnet 等先进专有模型持平;而 MT-R1-Zero-7B-Sem 变体在语义指标上实现最新SOTA成绩。此外,本工作在跨分布 MT 任务上展现出强大的泛化能力,稳健支持多语言和低资源场景。对不同初始化和奖励指标下模型行为的深度分析,为理解 R1-Zero 范式在 MT 领域中奖励设计、LLM 可适应性、训练动力学及涌现推理模式的关键作用提供了开创性见解。我们的代码已公开于 https://github.com/fzp0424/MT-R1-Zero。

关键词

引用

@article{arxiv.2504.10160,
  title  = {MT-R1-Zero: Advancing LLM-based Machine Translation via R1-Zero-like Reinforcement Learning},
  author = {Zhaopeng Feng and Shaosheng Cao and Jiahan Ren and Jiayuan Su and Ruizhe Chen and Yan Zhang and Zhe Xu and Yao Hu and Jian Wu and Zuozhu Liu},
  journal= {arXiv preprint arXiv:2504.10160},
  year   = {2025}
}

备注

Work in progress. Our code is available at https://github.com/fzp0424/MT-R1-Zero