中文

单模推理不确定性如何主导多模态大语言模型中的偏好动态:模态跟随的问题分析

人工智能 2025-11-05 v1

摘要

多模态大语言模型(MLLMs)在不同模态提供矛盾信息时需要解决冲突,这一过程我们称为模态跟随。以往的研究仅使用粗糙的数据集层面统计数据衡量了这一行为,忽视了模型在单模态推理中置信度的影响。在本文中,我们引入了一个新的框架,将模态跟随分解为两个基本因素:相对推理不确定性(单模态预测之间 case-specific 置信度差)和固有模态偏好(当不确定性平衡时,模型的稳定偏好)。为验证该框架,我们构建了一个可控数据集,系统性地变化视觉和文本输入的推理难度。采用熵作为细粒度不确定性度量,我们发现了一个普遍规律:跟随模态的概率随其相对不确定性单调递增地降低。在相对难度水平处(称为平衡点),模型倾向于以相似概率跟随两个模态,这一点是模型固有偏好实用指标。不同于传统的宏观比率,该度量提供了更原则性、更不受数据集制造物影响的方式来刻画模态偏好,使其独立于单模态能力和数据集制造物。进一步,通过探测层级预测,我们揭示了振荡的内部机制:在平衡点附近的模糊区域,模型在不同层之间在模态间反复摇摆,解释了外部观察到的犹豫不决。总体而言,这些发现确立了相对不确定性和固有偏好作为模态跟随的两个支配性原则,为量化框架和 MLLMs 解决冲突信息的机制性见解提供了依据。

关键词

引用

@article{arxiv.2511.02243,
  title  = {When Modalities Conflict: How Unimodal Reasoning Uncertainty Governs Preference Dynamics in MLLMs},
  author = {Zhuoran Zhang and Tengyue Wang and Xilin Gong and Yang Shi and Haotian Wang and Di Wang and Lijie Hu},
  journal= {arXiv preprint arXiv:2511.02243},
  year   = {2025}
}

备注

19 pages