中文

看得更清楚,推理更自信:面向视觉语言模型盲区的即插即用解决方案

计算机视觉与模式识别 2026-02-24 v1

摘要

视觉语言模型(Vision Language Models, VLMs)在广泛的视觉理解方面取得了显著成就,但在稀有对象上进行对象导向推理时仍面临挑战,因稀有实例在预训练数据中稀缺。虽然先前的做法通过检索额外数据或引入更强视觉编码器来缓解这一问题,但这些方法在微调 VLMs 时仍计算密集,且未充分利用原始训练数据。本文引入一个高效即插即用模块,通过细化视觉标记和丰富输入文本提示,在不对 VLMs 进行微调的情况下显著提高 VLMs 对稀有对象的推理能力。具体而言,我们提出通过利用视觉基础模型中的先验知识和同义词增强文本描述,学习稀有对象的多模态类嵌入,以弥补有限训练样本的不足。这些嵌入通过轻量级注意力增强模块细化 VLMs 中的视觉标记,从而提高细粒度对象细节。在此基础上,我们将所学嵌入用作对象感知检测器,以生成信息性提示,注入文本提示中以引导 VLMs 注意力聚焦于相关图像区域。两个基准测试上的实验表明,预训练 VLMs 在稀有对象识别和推理方面 consistently 实现显著提升。进一步分析揭示了本方法如何增强 VLMs 对稀有对象的聚焦与推理能力。

关键词

引用

@article{arxiv.2602.19615,
  title  = {Seeing Clearly, Reasoning Confidently: Plug-and-Play Remedies for Vision Language Model Blindness},
  author = {Xin Hu and Haomiao Ni and Yunbei Zhang and Jihun Hamm and Zechen Li and Zhengming Ding},
  journal= {arXiv preprint arXiv:2602.19615},
  year   = {2026}
}

备注

Accepted by CVPR 2026