学习何者重要:面向可解释视觉语言奖励建模的动态维度选择与聚合
计算与语言
2026-04-08 v1 人工智能
计算机视觉与模式识别
摘要
视觉语言奖励建模面临困境:生成式方法可解释但慢,判别式方法高效但作为“黑盒”不可靠。为弥合这一鸿沟,我们提出 VL-MDR (Vision-Language Multi-Dimensional Reward),一个动态分解评估为细粒度可解释维度的框架。VL-MDR 不输出单一标量,而是通过视觉感知门控机制识别相关维度并为每个特定输入自适应加权(如幻觉、推理)。为支持此目标,我们构建了包含 32.1 万组视觉语言偏好对的数据集,覆盖 21 个细粒度维度。大量实验表明,VL-MDR 在诸如 VL-RewardBench 等基准上 consistently 优于现有开源奖励模型。此外,我们展示 VL-MDR 构建的偏好对有效地启用 DPO 对齐,以减轻视觉幻觉并提升可靠性,为 VLM 对齐提供可扩展解决方案。
引用
@article{arxiv.2604.05445,
title = {Learning What Matters: Dynamic Dimension Selection and Aggregation for Interpretable Vision-Language Reward Modeling},
author = {Qiyuan Chen and Hongsen Huang and Jiahe Chen and Qian Shao and Jintai Chen and Hongxia Xu and Renjie Hua and Chuan Ren and Jian Wu},
journal= {arXiv preprint arXiv:2604.05445},
year = {2026}
}
备注
ACL 2026 Main