中文

面向多模态大语言模型的感知不确定性的探索性直接偏好优化

机器学习 2026-05-07 v1 计算与语言 计算机视觉与模式识别

摘要

直接偏好优化(DPO)已被证明是通过学习偏好对来缓解多模态大语言模型(MLLMs)中幻觉的有效解决方案。其关键挑战之一在于如何将序列级偏好转化为对视觉保真度的细粒度监督。为了保护容易产生幻觉的视觉相关 token,现有方法通常根据模型自身评估的视觉敏感性信号来分配训练重点。然而,这种由仍在训练中的模型估计出的敏感性引入了自指偏差:强化了已经学习得很好的视觉线索,却忽视了难以感知但至关重要的细节,从而限制了更深层的对齐。在这项工作中,我们提出了一种面向 MLLMs 的感知不确定性的探索性直接偏好优化(UE-DPO)方法,该方法使模型能够在 token 级认知不确定性的引导下,发现其认知缺陷并主动探索以进行自我纠正。具体而言,我们首先根据模型在给定图像中未能将 token 预测落地的失败来量化不确定性。然后,基于感知不确定性的探索强度,我们鼓励在偏好样本中对视觉缺陷 token 施加更多学习压力,并减轻对非偏好样本中有益知识的过度惩罚。此外,我们为该方法提供了理论证明,大量实验证明了其有效性和鲁棒性。

关键词

引用

@article{arxiv.2605.04874,
  title  = {Uncertainty-Aware Exploratory Direct Preference Optimization for Multimodal Large Language Models},
  author = {Huatian Zhang and Zhendong Mao and Lei Zhang and Yongdong Zhang},
  journal= {arXiv preprint arXiv:2605.04874},
  year   = {2026}
}