逻辑闭环:揭示大型视觉 - 语言模型中的物体幻觉
计算机视觉与模式识别
2024-07-01 v2 人工智能
计算与语言
机器学习
摘要
物体幻觉一直是阻碍大型视觉 - 语言模型(LVLMs)广泛应用的致命弱点。物体幻觉是指 LVLMs 声称图像中存在实际上并不存在的物体的现象。为缓解物体幻觉,研究者提出了指令微调和基于外部模型的检测方法,但这些方法要么需要大规模计算资源,要么依赖外部模型的检测结果。然而,利用 LVLM 自身来缓解物体幻觉这一领域尚未得到充分探索。在本工作中,我们采用如下直觉:LVLMs 对真实存在的物体倾向于做出逻辑一致的回应,而对幻觉物体则表现出不一致性。因此,我们提出了一种基于逻辑闭环的物体幻觉检测与缓解框架,即 LogicCheckGPT。具体而言,我们设计了逻辑一致性探测,通过提出具有逻辑关联的问题,询问物体的属性或反之,以此检验其回应是否能形成逻辑闭环,作为物体幻觉的指示器。作为一种即插即用方法,它可以无缝应用于所有现有的 LVLMs。在四个 LVLMs 上的三个基准测试中进行的综合实验表明,我们的方法带来了显著改进,证明了其有效性和通用性。
引用
@article{arxiv.2402.11622,
title = {Logical Closed Loop: Uncovering Object Hallucinations in Large Vision-Language Models},
author = {Junfei Wu and Qiang Liu and Ding Wang and Jinghao Zhang and Shu Wu and Liang Wang and Tieniu Tan},
journal= {arXiv preprint arXiv:2402.11622},
year = {2024}
}
备注
Accept to ACL 2024; 19 Pages, 15 Figures, 6 Tables