中文

抗模态冲突的鲁棒多模态大语言模型

计算机视觉与模式识别 2025-07-11 v1 人工智能 计算与语言

摘要

尽管多模态大语言模型(MLLMs)在视觉语言任务中展现出惊人的能力,但在实际场景中容易出现幻觉。本文从模态冲突视角考察MLLMs的幻觉现象。不同于既有研究聚焦于模型响应与输入之间的冲突,本文研究来自不同模态输入之间固有的冲突——这些冲突使MLLMs陷入困境并直接导致幻觉。我们正式定义模态冲突并构建名为Multimodal Modality Conflict(MMC)的数据集,以模拟视觉语言任务中的这一现象。提出三种基于提示工程、监督微调和强化学习的方法来缓解由模态冲突引起的幻觉。对MMC数据集上的大量实验旨分析这些方法的优势与局限。结果表明,强化学习方法在缓解模态冲突下的幻觉方面效果最佳,而监督微调方法表现出有前景且稳定的性能。我们的工作揭示了导致幻觉的未被注意到的模态冲突,并为MLLMs的鲁棒性提供了更多见解。

关键词

引用

@article{arxiv.2507.07151,
  title  = {Robust Multimodal Large Language Models Against Modality Conflict},
  author = {Zongmeng Zhang and Wengang Zhou and Jie Zhao and Houqiang Li},
  journal= {arXiv preprint arXiv:2507.07151},
  year   = {2025}
}

备注

ICML 2025