中文

AutoHallusion:自动生成幻觉基准测试的方法

计算机视觉与模式识别 2024-10-10 v2 计算与语言

摘要

大型视觉语言模型(LVLMs)容易产生幻觉现象,即图像中的某些情境线索会触发语言模块对异常或假设性对象进行过自信且不正确的推理。虽然已开发出一些用于调查 LVLM 幻觉的基准测试,但它们往往依赖人工构建的边界情况,其失效模式可能难以普遍化。此外,对这些示例进行微调可能会削弱其有效性。为此,我们致力于通过自动化方法规模化增加案例数量,减少人为偏见在构建此类边界情况中的作用。这促使我们开发 AutoHallusion,这是首个采用多种关键策略创建多样化幻觉示例的自动化基准测试生成方法。我们生成的视觉-问题对为 LVLMs 提供了显著的挑战,要求它们克服情境偏见和干扰,以得出正确答案。AutoHallusion 使我们能够以最低成本创建新的基准测试,从而克服了人工构建基准测试的脆弱性。它还揭示了常见的失效模式和原因,为检测、规避或控制幻觉提供了关键见解。对顶级 LVLMs 的全面评估表明,在 AutoHallusion 的合成数据集和真实世界数据集上,GPT-4V(ision)、Gemini Pro Vision、Claude 3 和 LLaVA-1.5 的幻觉诱导成功率分别达到了 97.7% 和 98.7%。这为在幻觉问题上持久战斗铺平了道路。代码和数据可在 https://github.com/wuxiyang1996/AutoHallusion 访问。

关键词

引用

@article{arxiv.2406.10900,
  title  = {AutoHallusion: Automatic Generation of Hallucination Benchmarks for Vision-Language Models},
  author = {Xiyang Wu and Tianrui Guan and Dianqi Li and Shuaiyi Huang and Xiaoyu Liu and Xijun Wang and Ruiqi Xian and Abhinav Shrivastava and Furong Huang and Jordan Lee Boyd-Graber and Tianyi Zhou and Dinesh Manocha},
  journal= {arXiv preprint arXiv:2406.10900},
  year   = {2024}
}