大型视觉语言模型对视觉缺失标记的响应解析
计算机视觉与模式识别
2025-09-08 v2 人工智能
摘要
大型视觉语言模型(LVLMs)通过联合解释视觉和文本输入来生成具有上下文相关性的响应。然而,我们的发现表明,它们常常误将缺乏视觉证据的文本输入错误地视为图像的一部分,从而导致错误响应。鉴于此发现,我们探讨了LVLMs是否内置了确定文本概念是否在图像中 grounding 的能力,并发现特定子集的前馈网络(FFN)神经元——称为视觉缺失感知(VA)神经元——通过 distinctive 激活模式持续信号视觉缺失。利用这些模式,我们开发了一个检测模块,系统分类输入标记是否具有视觉 grounding。根据其预测,我们提出一种方法,通过重新解释问题提示或替换检测到的缺失标记来优化输出。大量实验表明,我们的方法有效缓解了模型错误假设文本输入视觉存在的倾向,以及这种方法在各种LVLMs中的普适性。
关键词
引用
@article{arxiv.2509.03025,
title = {Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens},
author = {Sohee Kim and Soohyun Ryu and Joonhyung Park and Eunho Yang},
journal= {arXiv preprint arXiv:2509.03025},
year = {2025}
}
备注
accepted to EMNLP 2025