DT2IT-MRM:多模态奖励建模的去偏偏好构建与迭代训练
人工智能
2026-04-22 v1
摘要
多模态奖励模型(MRM)在使多模态大型语言模型(MLLM)与人类偏好对齐方面发挥着关键作用。训练良好的MRM需要高质量的多模态偏好数据。然而,现有的偏好数据集面临三个关键挑战:偏好强度缺乏粒度、文本风格偏差以及不可靠的偏好信号。此外,现有的开源多模态偏好数据集存在大量噪声,但缺乏有效且可扩展的整理方法来提升其质量。为了解决这些局限性,我们提出了 \textbf{DT2IT-MRM},它集成了一个去偏偏好构建流水线、一种对文本到图像(\textbf{T2I})偏好数据的新颖重构,以及一个迭代训练框架,用于为多模态奖励建模(\textbf{M}ultimodal \textbf{R}eward \textbf{M}odeling)整理现有的多模态偏好数据集。我们的实验结果表明,DT2IT-MRM在三个主要基准上实现了新的最优总体性能:VL-RewardBench、Multimodal RewardBench和MM-RLHF-RewardBench。
引用
@article{arxiv.2604.19544,
title = {DT2IT-MRM: Debiased Preference Construction and Iterative Training for Multimodal Reward Modeling},
author = {Zhihong Zhang and Jie Zhao and Xiaojian Huang and Jin Xu and Zhuodong Luo and Xin Liu and Jiansheng Wei and Xuejin Chen},
journal= {arXiv preprint arXiv:2604.19544},
year = {2026}
}
备注
code will be uploaded to https://github.com/zhang123434/DT2IT-MRM