中文

SSR-Zero:面向机器翻译的简单自奖励强化学习

计算与语言 2026-04-28 v4 人工智能 机器学习

摘要

大型语言模型(LLMs)最近在机器翻译(MT)方面展现出惊人的能力。然而,大多数先进的MT专用LLMs在训练时高度依赖外部监督信号,如人工标注参考数据或训练好的奖励模型(RMs),这些资源往往昂贵且难以规模化。为克服这一限制,我们提出一种简单的自奖励(SSR)强化学习(RL)框架,用于MT,该框架无参考、完全在线且仅依赖自我评判奖励。使用13K monolingual 示例和 Qwen-2.5-7B 作为底层模型,我们的模型 SSR-Zero-7B 在 WMT23、WMT24 和 Flores200 基准测试上的英中互译任务中,超过了 TowerInstruct-13B 和 GemmaX-28-9B 等现有MT专用LLMs,以及 Qwen2.5-32B-Instruct 等更大规模的通用LLMs。此外,通过在SSR中引入 COMET 的外部监督,我们最强的模型 SSR-X-Zero-7B 在英中互译中实现了SOTA,超越了所有72B参数以下的开源模型,甚至超过了闭源模型。我们的分析表明,与外部LLM-as-a-judge方法相比,自奖励机制在MT中的有效性,以及在结合训练好的RMs时具有互补优势。我们的发现为自我改进RL方法的潜力提供了宝贵见解。我们已公开代码、数据和模型。

关键词

引用

@article{arxiv.2505.16637,
  title  = {SSR-Zero: Simple Self-Rewarding Reinforcement Learning for Machine Translation},
  author = {Wenjie Yang and Mao Zheng and Mingyang Song and Zheng Li and Sitong Wang},
  journal= {arXiv preprint arXiv:2505.16637},
  year   = {2026}
}