中文

探讨与缓解大型视觉语言模型中的多模态幻觉叠加效应

计算机视觉与模式识别 2024-08-06 v4 人工智能 计算与语言

摘要

尽管在理解视觉信息方面与人类语言相当,大型视觉语言模型(LVLMs)仍然存在多模态幻觉问题。一个自然关切是,在多模态交互期间,生成的幻觉可能影响其后续生成。因此,我们提出了一个问题:当面对与先前生成的幻觉相关的查询时,LVLMs是否会被误导并作出错误回应,尽管存在真实的视觉信息?为此,我们提出了一个名为MMHalSnowball的框架来评估LVLMs在遇到生成的幻觉时的行为,其中LVLMs需要在精心构建的幻觉性对话中回答特定的视觉问题。关键的是,我们的实验显示,开源LVLMs的性能至少下降了31%,表明LVLMs容易接受生成的幻觉并提出不被干扰时所支持的虚假陈述。我们称此现象为多模态幻觉叠加效应。为缓解此问题,我们进一步提出一种无训练的方法称为残差视觉解码,其中我们修订了LVLMs的输出分布,来自残差视觉输入的分布,使模型能够直接获取视觉信息。实验表明,我们的方法可缓解至少24%的多模态幻觉叠加效应,同时保持能力。

关键词

引用

@article{arxiv.2407.00569,
  title  = {Investigating and Mitigating the Multimodal Hallucination Snowballing in Large Vision-Language Models},
  author = {Weihong Zhong and Xiaocheng Feng and Liang Zhao and Qiming Li and Lei Huang and Yuxuan Gu and Weitao Ma and Yuan Xu and Bing Qin},
  journal= {arXiv preprint arXiv:2407.00569},
  year   = {2024}
}

备注

Accepted to ACL 2024 Main Conference. 21 pages, 20 figures