HallE-Control:控制大视觉语言模型中的物体幻觉
计算机视觉与模式识别
2024-04-01 v3
摘要
当前大视觉语言模型(LMMs)取得了显著进展,但关于其准确理解视觉细节(即进行详细描述)的能力仍存在显著不确定性。为此,我们提出 ,一种由 GPT-4 辅助的详细描述评测方法。有趣的是,尽管 LMMs 在现有 VQA 基准中表现出极少的物体存在幻觉,我们提出的评测却揭示了其对这类幻觉的持续易感性。本文首次尝试从不同方面探究此类幻觉,包括图像分辨率、语言解码器规模以及指令数据的数量、质量和粒度。我们的发现强调了当语言描述包含比视觉模块所能定位或验证的更细物体粒度的细节时,会产生无根据的推断,从而诱发幻觉。为控制此类幻觉,我们进一步将描述可靠性归因于上下文知识(仅涉及上下文中有据可依的物体)和参数知识(包含模型推断出的物体)。因此,我们提出 ,一种在物体存在(ucination in object xistence)方面可控的 LMM。HallE-Control 可调节描述,在(i)仅描绘有根据物体的上下文知识与(ii)将其与参数知识混合以想象推断物体之间切换。与 LLaVA 相比,我们的方法将幻觉降低了 44%,并保持了物体覆盖率。
引用
@article{arxiv.2310.01779,
title = {HallE-Control: Controlling Object Hallucination in Large Multimodal Models},
author = {Bohan Zhai and Shijia Yang and Chenfeng Xu and Sheng Shen and Kurt Keutzer and Chunyuan Li and Manling Li},
journal= {arXiv preprint arXiv:2310.01779},
year = {2024}
}
备注
Our code is publicly available at https://github.com/bronyayang/HallE_Control