中文

M-RewardBench:多语言环境下的奖励模型评估基准

计算与语言 2025-05-21 v3 人工智能 机器学习

摘要

奖励模型(Reward Models, RMs)通过实现人类反馈在语言建模过程中的集成,推动了今天 LLMs 的最先进性能。然而,奖励模型主要在英语中进行训练和评估,其在多语言环境中的能力仍大体未被研究。在本工作中,我们系统评估了多个奖励模型在多语言环境中的表现。我们首先构建了首个其类型多语言奖励模型评估基准,M-RewardBench,包含 2.87k 条偏好实例,覆盖 23 种类型多样的语言,测试奖励模型在聊天、安全、推理和翻译方面的能力。我们随后对广泛的奖励模型在 M-RewardBench 上进行严格评估,为其在不同语言中的性能提供了新视角。我们识别出奖励模型在英语和非英语语言之间性能存在显著差距,并表明奖励模型的偏好随语言的不同而发生显著变化。我们还就不同的多语言方面对奖励模型性能的影响提出了若干发现。具体而言,我们表明奖励模型的性能在翻译质量得到改善后得到提升。类似地,我们展示了模型在高资源语言上的表现更佳。我们在本研究中发布了 M-RewardBench 数据集和代码基地,以促进对奖励模型在多语言环境中评估的更好理解。

关键词

引用

@article{arxiv.2410.15522,
  title  = {M-RewardBench: Evaluating Reward Models in Multilingual Settings},
  author = {Srishti Gureja and Lester James V. Miranda and Shayekh Bin Islam and Rishabh Maheshwary and Drishti Sharma and Gusti Winata and Nathan Lambert and Sebastian Ruder and Sara Hooker and Marzieh Fadaee},
  journal= {arXiv preprint arXiv:2410.15522},
  year   = {2025}
}

备注

16 pages, 6 figures, 10 tables. Website: https://m-rewardbench.github.io/ , Updated results with latest models. Added more author information