中文

CARPE:基于集成的上下文感知图像表征优先化用于大型视觉语言模型

计算机视觉与模式识别 2026-03-30 v3 人工智能

摘要

大型视觉语言模型(LVLMs)通常使用自回归语言建模目标进行训练,将视觉表征与语言空间对齐。虽然这种对齐对多模态推理有效,但它可能会削弱以视觉为中心的能力,导致 LVLMs 在图像分类等任务上的表现不如其基础视觉编码器。为了解决这一局限性,我们提出了基于集成的上下文感知图像表征优先化(CARPE),这是一个轻量级框架,通过视觉集成层和上下文感知集成机制将原始视觉特征与对齐的 LLM 表征相结合。这种设计增强了模型自适应加权视觉和文本模态的能力,并使模型能够捕捉图像表征的各个方面。大量实验表明,CARPE 在图像分类和多样化的视觉语言基准测试上均提升了性能。我们的结果表明,模态平衡通过改善自回归 LVLMs 内的表征利用率,在多模态泛化中起着关键作用。

关键词

引用

@article{arxiv.2601.13622,
  title  = {CARPE: Context-Aware Image Representation Prioritization via Ensemble for Large Vision-Language Models},
  author = {Donghee Lee and Rui Cai and Zhe Zhao},
  journal= {arXiv preprint arXiv:2601.13622},
  year   = {2026}
}