中文

Omni-RRM:通过自动化基于 Rubric 的偏好合成推进 Omni Reward Modeling

计算与语言 2026-02-03 v1

摘要

多模态大语言模型(MLLMs)已展现出惊人的能力,但其性能常受限于现有对齐技术的粗糙性。一个关键瓶颈是缺乏有效的奖励模型(RM):现有的 RM 主要以视觉为中心,输出不透明的标量分数,且依赖高昂的人类标注。我们引入了 Omni-RRM,这是第一个开源的基于 Rubric 的奖励模型,能够在 text、image、video 和 audio 四大模态下产生结构化的多维偏好判断,并提供维度级的依据。我们方法的核心是 Omni-Preference,即通过一个完全自动化的管道构建的大规模数据集:我们通过对比不同能力的模型来合成候选响应对,并使用强大的教师模型来"调和和过滤"偏好,同时为每一对提供一种受模态影响的"Rubric-依据"论述。这消除了对人类标注训练偏好的需求。Omni-RRM 在两个阶段中进行训练:首先进行监督式微调以学习 Rubric-依据的输出,然后进行强化学习(GRPO)以在难以区分的低对比度对上 sharpen 判别。全面评估显示,Omni-RRM 在 video(ShareGPT-V 上达到 80.2%)和 audio(Audio-HH-RLHF 上达到 66.8%)基准上实现了最先进的准确率,并在 image 任务上显著优于现有开源 RM,整体准确率相较其基础模型提升了 17.7%。Omni-RRM 还通过 Best-of-NN 选择改进了下游性能,并可转移到 text-only 偏好基准。我们的数据、代码和模型均可在 https://anonymous.4open.science/r/Omni-RRM-CC08 获取。

关键词

引用

@article{arxiv.2602.00846,
  title  = {Omni-RRM: Advancing Omni Reward Modeling via Automatic Rubric-Grounded Preference Synthesis},
  author = {Zicheng Kong and Dehua Ma and Zhenbo Xu and Alven Yang and Yiwei Ru and Haoran Wang and Zixuan Zhou and Fuqing Bie and Liuyu Xiang and Huijia Wu and Jian Zhao and Zhaofeng He},
  journal= {arXiv preprint arXiv:2602.00846},
  year   = {2026}
}