超越逻辑镜头:面向视觉-语言模型的稳健幻觉检测与定位
计算与语言
2025-02-20 v2
摘要
大型多模态模型 (LMM) 的快速发展显著推动了多模态理解,凭借大型语言模型 (LLM) 的语言能力和模态特定编码器的集成。然而,LMM 常出现幻觉现象,限制了其可靠性和采纳。虽然传统方法检测和缓解幻觉常需高成本训练或依赖外部模型,但最近利用内部模型特征的近新方法呈现了前景。在本文中,我们批判性地评估了面向通用视觉幻觉的基于逻辑镜头的训练-free 技术的局限性。我们引入ContextualLens,一种利用 LMM 中中间层上下文标记嵌入的改进方法。该方法在包括动作和 OCR 在内的多样类别上显著提升了幻觉检测和定位能力,在空间关系和属性比较等需要上下文理解的任务中也表现出色。我们新颖的定位技术可实现高度精确的边界框,从而促进从零-shot目标分割向 grounding 视觉问答的转变。我们的贡献为构建更可靠和可解释的多模态模型指明了方向。
引用
@article{arxiv.2411.19187,
title = {Beyond Logit Lens: Contextual Embeddings for Robust Hallucination Detection & Grounding in VLMs},
author = {Anirudh Phukan and Divyansh and Harshit Kumar Morj and Vaishnavi and Apoorv Saxena and Koustava Goswami},
journal= {arXiv preprint arXiv:2411.19187},
year = {2025}
}
备注
Accepted to NAACL 2025 Main