中文

A-VL:面向大型视觉语言模型的自适应注意力

人工智能 2025-02-10 v2 计算机视觉与模式识别

摘要

大型视觉语言模型 (LVLM) 集成了计算机视觉和自然语言处理技术,具有巨大的应用潜力。然而,这些模型在推理过程中需要大量资源。自适应注意力技术可以动态减少计算冗余,从而提高效率。虽然当前的自适应注意力方法显著降低了基于 Transformer 的语言模型的内存需求,但并未针对 LVLMs 进行优化。我们观察到 LVLMs 会从遥远的图像标记和局部文本标记中生成响应,不同模态具有不同的注意力模式。基于此观察,我们提出为每个模态分别管理注意力。具体而言,对于视觉输入,我们存储可能有用的信息,但仅计算最关键的部分。对于语言输入,我们更关注局部信息。基于我们对视觉语言注意力模式的观察与分析,我们开发了 A-VL,这是一种针对 LVLM 推理的即插即用自适应注意力方法。在三个视觉语言任务和五个数据集上的广泛评估表明,我们的设计有效。我们的方法 A-VL 在降低内存使用和计算负载方面超过越权自适应注意力方法,而不会损害性能。

关键词

引用

@article{arxiv.2409.14846,
  title  = {A-VL: Adaptive Attention for Large Vision-Language Models},
  author = {Junyang Zhang and Mu Yuan and Ruiguang Zhong and Puhan Luo and Huiyou Zhan and Ningkang Zhang and Chengchen Hu and Xiangyang Li},
  journal= {arXiv preprint arXiv:2409.14846},
  year   = {2025}
}

备注

AAAI 2025 Accepted