中文

Volcano:通过自反馈引导修正缓解多模态幻觉

计算与语言 2024-04-03 v4 计算机视觉与模式识别

摘要

大型多模态模型存在多模态幻觉问题,即它们给出的错误回复与给定视觉信息不一致。近期工作推测,多模态幻觉背后的原因之一在于视觉编码器未能正确地基于图像进行接地。为缓解该问题,我们提出一种利用自反馈作为视觉线索的新方法。基于此,我们引入 Volcano,一种多模态自反馈引导修正模型。Volcano 基于提供的视觉信息对其初始回复生成自然语言反馈,并利用该反馈对初始回复进行自我修正。Volcano 有效减少了多模态幻觉,并在 MMHal-Bench、POPE 和 GAVIE 上取得最先进(SOTA)性能。它还提升了通用多模态能力,并在 MM-Vet 和 MMBench 上优于先前模型。通过定性分析,我们表明 Volcano 的反馈比初始回复更恰当地基于图像接地。这表明 Volcano 可通过反馈生成为其自身提供更丰富的视觉信息,从而实现幻觉的自纠正。我们在 https://github.com/kaistAI/Volcano 公开发布模型、数据与代码。

关键词

引用

@article{arxiv.2311.07362,
  title  = {Volcano: Mitigating Multimodal Hallucination through Self-Feedback Guided Revision},
  author = {Seongyun Lee and Sue Hyun Park and Yongrae Jo and Minjoon Seo},
  journal= {arXiv preprint arXiv:2311.07362},
  year   = {2024}
}