视觉编码器是否真的解释了对象幻觉?基于简单细粒度CLIPScore的幻觉消除方法
计算机视觉与模式识别
2026-01-05 v4 计算与语言
摘要
最近的大型视觉语言模型(LVLMs)在 various 领域显示出卓越的性能,但这些模型 suffer from object hallucination(对象幻觉)。本文主要在判别式、检索式评估场景(OHD-Caps)中研究对象幻觉,而非自由形式的描述生成。该研究重新审视了导致此类幻觉的前述说法,即视觉编码器的表示容量有限。我们的分析表明,视觉编码器的容量并非检测对象幻觉的主要限制因素。基于此洞见,我们提出了细粒度CLIPScore(Fine-grained CLIPScore, F-CLIPScore),一种简单而有效的评估指标,通过在名词层面融合文本嵌入来增强对象级别的细粒度。在OHD-Caps基准测试上的评估显示,F-CLIPScore在准确率上显著优于传统CLIPScore,提升幅度达39.6%,且无需额外训练。我们进一步表明,基于F-CLIPScore的数据过滤可减少LVLMs中的对象幻觉(在对齐预训练后,POPE准确率提升4.9%)。我们的代码已公开:https://github.com/abzb1/f-clip。
引用
@article{arxiv.2502.20034,
title = {Do Vision Encoders Truly Explain Object Hallucination?: Mitigating Object Hallucination via Simple Fine-Grained CLIPScore},
author = {Hongseok Oh and Wonseok Hwang},
journal= {arXiv preprint arXiv:2502.20034},
year = {2026}
}
备注
Transactions on Machine Learning Research