THRONE:针对大型视觉语言模型自由生成内容的基于对象的幻觉基准
计算机视觉与模式识别
2025-04-04 v2 人工智能
机器学习
摘要
缓解大型视觉语言模型(LVLM)中的幻觉仍是一个悬而未决的问题。现有的基准并未解决开放式自由形式回答中的幻觉问题,我们将其称为“第一类幻觉”。相反,它们侧重于针对非常特定问题格式的幻觉——通常是关于特定对象或属性的多项选择回答——我们将其称为“第二类幻觉”。此外,此类基准通常需要对模型进行外部 API 调用,而这些模型容易发生变化。在实践中,我们观察到第二类幻觉的减少并未导致第一类幻觉的减少,而是这两种形式的幻觉往往呈负相关。为了解决这一问题,我们提出了 THRONE,一种新颖的基于对象的自动化框架,用于定量评估 LVLM 自由形式输出中的第一类幻觉。我们使用公共语言模型(LM)来识别 LVLM 回答中的幻觉并计算具有信息量的指标。通过使用公共数据集对大量近期的 LVLM 进行评估,我们表明现有指标的改进并未导致第一类幻觉的减少,并且用于衡量第一类幻觉的现有基准是不完整的。最后,我们提供了一种简单有效的数据增强方法来减少第一类和第二类幻觉,以此作为强有力的基线。代码现已在 https://github.com/amazon-science/THRONE 提供。
引用
@article{arxiv.2405.05256,
title = {THRONE: An Object-based Hallucination Benchmark for the Free-form Generations of Large Vision-Language Models},
author = {Prannay Kaul and Zhizhong Li and Hao Yang and Yonatan Dukler and Ashwin Swaminathan and C. J. Taylor and Stefano Soatto},
journal= {arXiv preprint arXiv:2405.05256},
year = {2025}
}
备注
In CVPR 2024. Code https://github.com/amazon-science/THRONE