图像中有什么?对视觉语言模型视觉的深度分析
计算机视觉与模式识别
2024-11-27 v1 人工智能
摘要
视觉语言模型(VLMs)最近在理解复杂视觉内容方面展现了惊人的能力。然而,这些模型如何处理视觉信息的机制仍然鲜为人知。本文对注意力模块 across layers进行彻底的经验分析,揭示了这些模型处理视觉数据的几个关键见解:(i)查询 token的内部表示(例如“描述图像”的表示)被 VLMs 用于存储全局图像信息;我们演示了这些模型仅凭这些 token就能生成惊人描述性回应,而无需直接访问图像 token。(ii)跨模态信息流主要受中间层(约占所有层的25%)影响,而早期和后期层仅贡献有限。(iii)细粒度视觉属性和对象细节直接从图像 token以空间局部化方式提取,即与特定对象或属性相关的生成 token注意力强烈地关联到图像中的对应区域。我们提出了新颖的定量评估来验证我们的观察,利用真实世界的复杂视觉场景。最后,我们展示了这些发现在促进先进 VLMs 中高效视觉处理方面的潜力。
引用
@article{arxiv.2411.17491,
title = {What's in the Image? A Deep-Dive into the Vision of Vision Language Models},
author = {Omri Kaduri and Shai Bagon and Tali Dekel},
journal= {arXiv preprint arXiv:2411.17491},
year = {2024}
}