中文

BIMA:面向大型视觉语言模型幻觉预测与缓解的双射最大似然学习方法

计算机视觉与模式识别 2025-06-02 v1 人工智能

摘要

大型视觉语言模型已被广泛采用以推进各个领域的发展。然而,开发具有可解释特征且值得信赖的大规模模型系统是一项重大挑战。与这些系统产生的谬误函数相关的最普遍术语之一是幻觉,即语言模型生成的响应与视觉内容不对应。为了缓解这一问题,已有多种方法被开发出来,其中一个突出方向是改进解码过程。在本文中,我们提出了一种新的双射最大似然学习(BIMA)方法,利用归一化流理论来缓解幻觉。所提出的 BIMA 方法能够有效缓解主流视觉语言模型中的幻觉问题,带来显著改善。值得注意的是,BIMA 在 POPE 基准上取得了 85.06% 的平均 F1 分数,并分别将 CHAIRS 和 CHAIRI 显著降低了 7.6% 和 2.6%。据我们所知,这是最早考虑利用双射手段来减少大型视觉语言模型引发幻觉的研究之一。

关键词

引用

@article{arxiv.2505.24649,
  title  = {BIMA: Bijective Maximum Likelihood Learning Approach to Hallucination Prediction and Mitigation in Large Vision-Language Models},
  author = {Huu-Thien Tran and Thanh-Dat Truong and Khoa Luu},
  journal= {arXiv preprint arXiv:2505.24649},
  year   = {2025}
}

备注

CVPRW 2025, 8 pages, 4 figures