CutPaste&Find:基于视觉辅助知识库的高效多模态幻觉检测器
计算机视觉与模式识别
2025-08-06 v2 计算与语言
摘要
大型视觉语言模型(LVLMs)在多模态推理方面展现了惊人的能力,但仍然容易受到幻觉影响,尤其是对象幻觉,即在生成的描述中虚构不存在的对象或错误属性。现有检测方法虽然取得了良好性能,但依赖大量昂贵的 API 调用和基于迭代的 LVLMs 验证,难以应用于大规模或离线场景。为克服这些限制,我们提出了 CutPaste\&Find,一个轻量级且无需训练的框架,用于检测 LVLMs 生成输出中的幻觉。我们的方法利用即插即用的视觉和语言模块高效地执行多步骤验证,而无需进行 LVLMs 推理。在我们的框架核心是一个视觉辅助知识库(Visual-aid Knowledge Base),它编码了丰富的实体-属性关系及其相关图像表示。我们引入一个缩放因子来细化相似度得分,缓解即使对于ground-truth图像-文本对也存在次优对齐值的问题。针对基准数据集(包括 POPE 和 R-Bench)进行了全面评估,结果表明 CutPaste\&Find 在检测幻觉方面达到了竞争性的性能,同时显著更高效和经济实惠。
引用
@article{arxiv.2502.12591,
title = {CutPaste&Find: Efficient Multimodal Hallucination Detector with Visual-aid Knowledge Base},
author = {Cong-Duy Nguyen and Xiaobao Wu and Duc Anh Vu and Shuai Zhao and Thong Nguyen and Anh Tuan Luu},
journal= {arXiv preprint arXiv:2502.12591},
year = {2025}
}