中文

Pensieve:先回溯再比较,缓解视觉幻觉

计算机视觉与模式识别 2024-09-04 v2

摘要

多模态大语言模型(MLLMs)在各类视觉-语言任务中展现出显著成功。然而,它们饱受视觉幻觉困扰,即生成的回答与给定图像不符。当MLLMs产生幻觉时,它们是否对准确的视觉线索视而不见?我们的研究表明,视觉分支可能同时支持准确和错误的内容。为解决这一问题,我们提出Pensieve,一种无需训练的方法,利用由共享语义和外观特征的图像引发的类似视觉幻觉来缓解幻觉。具体而言,Pensieve使MLLMs回溯相关图像作为参考,并通过置信度分数相减来比较其视觉内容与测试图像。此外,我们的范式通过自适应缩放相减后的分数,平衡了处理视觉和文本分支错误的效果。在Whoops、LLaVA Bench、POPE和MME上的实验证明了Pensieve在缓解视觉幻觉方面的有效性,超越了其他先进的解码策略。Pensieve还能帮助MLLMs识别视觉细节,并增强生成图像描述的特异性。

关键词

引用

@article{arxiv.2403.14401,
  title  = {Pensieve: Retrospect-then-Compare Mitigates Visual Hallucination},
  author = {Dingchen Yang and Bowen Cao and Guang Chen and Changjun Jiang},
  journal= {arXiv preprint arXiv:2403.14401},
  year   = {2024}
}