中文

DT2IT-MRM:多模态奖励建模的去偏偏好构建与迭代训练

人工智能 2026-04-22 v1

摘要

多模态奖励模型(MRM)在使多模态大型语言模型(MLLM)与人类偏好对齐方面发挥着关键作用。训练良好的MRM需要高质量的多模态偏好数据。然而,现有的偏好数据集面临三个关键挑战:偏好强度缺乏粒度、文本风格偏差以及不可靠的偏好信号。此外,现有的开源多模态偏好数据集存在大量噪声,但缺乏有效且可扩展的整理方法来提升其质量。为了解决这些局限性,我们提出了 \textbf{DT2IT-MRM},它集成了一个去偏偏好构建流水线、一种对文本到图像(\textbf{T2I})偏好数据的新颖重构,以及一个迭代训练框架,用于为多模态奖励建模(\textbf{M}ultimodal \textbf{R}eward \textbf{M}odeling)整理现有的多模态偏好数据集。我们的实验结果表明,DT2IT-MRM在三个主要基准上实现了新的最优总体性能:VL-RewardBench、Multimodal RewardBench和MM-RLHF-RewardBench。

关键词

引用

@article{arxiv.2604.19544,
  title  = {DT2IT-MRM: Debiased Preference Construction and Iterative Training for Multimodal Reward Modeling},
  author = {Zhihong Zhang and Jie Zhao and Xiaojian Huang and Jin Xu and Zhuodong Luo and Xin Liu and Jiansheng Wei and Xuejin Chen},
  journal= {arXiv preprint arXiv:2604.19544},
  year   = {2026}
}

备注

code will be uploaded to https://github.com/zhang123434/DT2IT-MRM