中文

参考无关的强化学习微调用于机器翻译:从序列到序列的视角

计算与语言 2026-05-18 v1 人工智能

摘要

生产环境中的机器翻译主要依赖于编码器-解码器 Seq2Seq 模型,但强化学习方法的机器翻译微调主要针对参数≥7B的解码器-only 大语言模型,且对编码器-解码器架构缺乏系统性研究。我们将群相对政策优化(GRPO)应用于 NLLB-200(600M 和 1.3B 参数),采用混合参考无关奖励函数(LaBSE 和 COMET-Kiwi),在微调时无需平行数据,并在13种类型多样的语言上进行评估。GRPO 在所有13种语言上均实现一致的改进,其中对繁体中文提升最高可达+5.03 chrF++,且在无目标语言数据的情况下,仍能与3轮监督微调在形态学复杂语言上达到竞争水平。我们发现, gains 在基线性能最弱且奖励可区分性最高的地方最大,这正是平行数据最稀缺的地方,使该方法最为有效。我们在英语和西班牙语源语言上复制了这一模式。

关键词

引用

@article{arxiv.2605.15976,
  title  = {Reference-Free Reinforcement Learning Fine-Tuning for MT: A Seq2Seq Perspective},
  author = {Ernesto Garcia-Estrada and Carlos Escolano and José A. R. Fonallosa},
  journal= {arXiv preprint arXiv:2605.15976},
  year   = {2026}
}