魔鬼藏在细节之中:针对通用多模态奖励模型中的单模态伪相关问题
计算与语言
2025-05-22 v4 人工智能
摘要
多模态奖励模型(MM-RMs)是对齐大型语言模型(LLMs)与人类偏好关系的关键工具,尤其是随着 LLMs 越来越多地与多模态数据交互。然而,我们发现基于现有数据集训练的 MM-RMs 常常难以泛化到分布外数据,因为它们依赖于单模态伪相关——主要是训练分布内的文本-only 捷径——这会阻碍其发挥真正的多模态奖励函数的作用。为此,我们引入一种快捷感知的 MM-RM 学习算法,通过动态重新加权训练样本来缓解这一问题,将分布转向更好的多模态理解,从而减少对单模态伪相关的依赖。我们的实验表明,这在泛化性、下游任务性能和可扩展性方面均取得显著提升,构建了一个更稳健的多模态奖励建模框架。
引用
@article{arxiv.2503.03122,
title = {The Devil Is in the Details: Tackling Unimodal Spurious Correlations for Generalizable Multimodal Reward Models},
author = {Zichao Li and Xueru Wen and Jie Lou and Yuqiu Ji and Yaojie Lu and Xianpei Han and Debing Zhang and Le Sun},
journal= {arXiv preprint arXiv:2503.03122},
year = {2025}
}
备注
ICML 2025