A-VL:面向大型视觉语言模型的自适应注意力
人工智能
2025-02-10 v2 计算机视觉与模式识别
摘要
大型视觉语言模型 (LVLM) 集成了计算机视觉和自然语言处理技术,具有巨大的应用潜力。然而,这些模型在推理过程中需要大量资源。自适应注意力技术可以动态减少计算冗余,从而提高效率。虽然当前的自适应注意力方法显著降低了基于 Transformer 的语言模型的内存需求,但并未针对 LVLMs 进行优化。我们观察到 LVLMs 会从遥远的图像标记和局部文本标记中生成响应,不同模态具有不同的注意力模式。基于此观察,我们提出为每个模态分别管理注意力。具体而言,对于视觉输入,我们存储可能有用的信息,但仅计算最关键的部分。对于语言输入,我们更关注局部信息。基于我们对视觉语言注意力模式的观察与分析,我们开发了 A-VL,这是一种针对 LVLM 推理的即插即用自适应注意力方法。在三个视觉语言任务和五个数据集上的广泛评估表明,我们的设计有效。我们的方法 A-VL 在降低内存使用和计算负载方面超过越权自适应注意力方法,而不会损害性能。
关键词
引用
@article{arxiv.2409.14846,
title = {A-VL: Adaptive Attention for Large Vision-Language Models},
author = {Junyang Zhang and Mu Yuan and Ruiguang Zhong and Puhan Luo and Huiyou Zhan and Ningkang Zhang and Chengchen Hu and Xiangyang Li},
journal= {arXiv preprint arXiv:2409.14846},
year = {2025}
}
备注
AAAI 2025 Accepted