LV-XAttn:用于多模态大语言模型中处理长视觉输入的分布式跨注意力机制
计算机视觉与模式识别
2025-05-29 v3 人工智能
分布式、并行与集群计算
机器学习
摘要
跨注意力在多模态大语言模型(MLLMs)中常用于将视觉信息整合到语言主干中。然而,在大视觉输入(如视频理解)的应用中,处理大量视觉标记在跨注意力层会导致高内存需求,常需在多个 GPU 上进行分布式计算。现有分布式注意力机制面临显著通信开销,使跨注意力层成为 MLLMs 高效训练和推理的关键瓶颈。为此,我们提出了 LV-XAttn,一种具有最小通信开销的分布式、精确跨注意力机制。我们观察到,在涉及大视觉输入的应用中,查询块的大小通常远小于键值块的大小。因此,在 LV-XAttn 中,我们将较大的键值块保留在每个 GPU 的本地,并在 GPU 之间交换较小的查询块。我们还引入一种高效的激活重计算技术,以支持更长的视觉上下文。我们对 LV-XAttn 的通信优势进行了理论分析,并表明其可为广泛的模型实现加速。我们的评估使用 Llama 3-V、mPLUG-Owl3 和 OpenFlamingo 模型发现,LV-XAttn 相对于现有方法实现了最高可达 10.62 倍的端到端加速。
引用
@article{arxiv.2502.02406,
title = {LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models},
author = {Tzu-Tao Chang and Shivaram Venkataraman},
journal= {arXiv preprint arXiv:2502.02406},
year = {2025}
}