中文

mR3:多语言无评分标准奖励推理模型

计算与语言 2026-01-29 v2 人工智能 机器学习

摘要

使用大型语言模型(LLM)评判器进行评估在英语领域已被广泛采用并显示出良好效果。然而,其在非英语语境中的表现未能很好地泛化,目前尚不清楚何种有效的多语言训练策略适用于此类评判器。本文引入mR3(massively multilingual, rubric-agnostic reward reasoning model),一个覆盖72种语言的大规模多语言奖励推理模型,实现了目前最广泛的语言覆盖范围。我们进行了完整的研究,探讨数据和课程选择对奖励模型训练的影响,以识别构建高质量奖励模型的有效策略,包括对目标语言推理的支持。我们的方法在多语言奖励模型基准测试中实现了领先性能,凭借大幅度的模型规模(如GPT-OSS-120B)就能超越,且模型规模可达9倍。通过大量消融实验进一步确认了其有效性。最后,我们在离线偏好优化中展示了mR3的有效性,并通过12种语言、20名注释员的人类研究,验证了其推理痕迹和基于评分标准的评估质量,其中mR3模型的推理被优先选中,包括对完全未见过的极低资源语言。我们的模型、数据和代码已开源发布于https://github.com/rubricreward/mr3。

关键词

引用

@article{arxiv.2510.01146,
  title  = {mR3: Multilingual Rubric-Agnostic Reward Reasoning Models},
  author = {David Anugraha and Shou-Yi Hung and Zilu Tang and Annie En-Shiun Lee and Derry Tanti Wijaya and Genta Indra Winata},
  journal= {arXiv preprint arXiv:2510.01146},
  year   = {2026}
}

备注

Accepted to ICLR 2026