基于 Rubric 奖励的视觉偏好优化
计算机视觉与模式识别
2026-04-15 v1 人工智能
摘要
直接偏好优化(DPO)的效果取决于能反映多模态任务中质量差异的偏好数据。现有流程常依赖基于结果的粗糙信号或离策略扰动,难以适用于细粒度的视觉推理。我们提出 rDPO,这是一种基于实例特定 Rubric 的偏好优化框架。对于每一组图像-指令对,我们构建一个包含必需和附加准则的清单式 Rubric,用于对来自任何可能策略的响应进行评分。该指令-Rubric 池在离线构建后,可在构建在策略数据时重复使用。在公开的奖励建模基准上,基于 Rubric 的提示方式大幅提升了 30B-A3B 判分器的性能,使其接近 GPT-5.4。在公开的下游基准测试中,基于 Rubric 的过滤将宏平均值提升至 82.69,而基于结果的过滤则从 81.14 下降至 75.82。当在全面基准上评估可扩展性时,rDPO 达到 61.01,显著优于风格约束基线(52.36),并超越 59.48 的基础模型。综上,这些结果表明,视觉偏好优化受益于将策略数据构建与实例特定准则水平反馈相结合。
引用
@article{arxiv.2604.13029,
title = {Visual Preference Optimization with Rubric Rewards},
author = {Ya-Qi Yu and Fangyu Hong and Xiangyang Qu and Hao Wang and Gaojie Wu and Qiaoyu Luo and Nuo Xu and Huixin Wang and Wuheng Xu and Yongxin Liao and Zihao Chen and Haonan Li and Ziming Li and Dezhi Peng and Minghui Liao and Jihao Wu and Haoyu Ren and Dandan Tu},
journal= {arXiv preprint arXiv:2604.13029},
year = {2026}
}