GRRM:面向机器翻译的群相对奖励建模
计算与语言
2026-02-17 v1
摘要
虽然群相对政策优化 (GRPO) 为 LLM 后训练提供了一个强大的框架,但其在开放域任务如机器翻译中的有效性取决于准确的群内排序。我们指出,标准标量质量指标 (SQM) 在此上下文中不足;通过单独评估候选方案,它们缺乏必要的比较背景来区分细粒度的语言细微差异。为此,我们提出了群质量指标 (GQM) 框架并通过群相对奖励模型 (GRRM) 实现。不同于传统的独立评分器,GRRM 同时处理整个候选群组,利用比较分析来严格解决相对质量和自适应细粒度。经验评估确认,GRRM 在所有基线中实现了具竞争力的排序准确性。基于此,我们将 GRRM 集成到 GRPO 训练循环中以优化翻译策略。实验结果表明,我们的框架不仅提高了一般翻译质量,还解锁了与最先进推理模型相当的推理能力。我们在 https://github.com/NJUNLP/GRRM 上发布代码、数据集和模型检查点。
引用
@article{arxiv.2602.14028,
title = {GRRM: Group Relative Reward Modeling for Machine Translation},
author = {Sen Yang and Shanbo Cheng and Lu Xu and Jianbing Zhang and Shujian Huang},
journal= {arXiv preprint arXiv:2602.14028},
year = {2026}
}
备注
19 pages, 6 figures