多模态之诅:评估包含语言、视觉与音频的大型多模态模型中的幻觉现象
计算机视觉与模式识别
2024-10-17 v1
摘要
近期大型多模态模型(LMM)的快速发展显著提升了其在多样化任务上的性能,尽管正在不断努力进一步集成诸如视频和音频等额外模态。然而,大多数现有LMM仍然容易受到幻觉(即事实多模态输入与生成文本输出之间的差异)问题影响,这限制了其在各种实际场景中的应用。本文提出了首个系统性调查LMM中幻觉现象的研究,涵盖三种最常见的模态:语言、视觉与音频。我们的研究揭示了导致幻觉的两个关键因素:过度依赖单模态先验,以及不正当的跨模态相关性。为此,我们引入了名为“多模态之诅”(The Curse of Multi-Modalities, CMM)的基准测试,全面评估了LMM中的幻觉问题,并对其背后的问题进行了详细分析。我们的发现突显了关键脆弱性,包括模态集成的不平衡以及训练数据中的偏见,凸显了需要在跨模态学习中实现平衡以及增强幻觉缓解策略的必要性。基于我们的观察与发现,我们提出了可能提高LMM可靠性的潜在研究方向。
引用
@article{arxiv.2410.12787,
title = {The Curse of Multi-Modalities: Evaluating Hallucinations of Large Multimodal Models across Language, Visual, and Audio},
author = {Sicong Leng and Yun Xing and Zesen Cheng and Yang Zhou and Hang Zhang and Xin Li and Deli Zhao and Shijian Lu and Chunyan Miao and Lidong Bing},
journal= {arXiv preprint arXiv:2410.12787},
year = {2024}
}
备注
Project Page: cmm-damovl.site