CrossLMM:通过双重跨注意力机制解耦 LMM 中的长视频序列
计算机视觉与模式识别
2025-12-23 v2
摘要
大型多模态模型 (LMM) 的出现显著提升了大型语言模型 (LLM) 处理和解释多种数据模态(如图像和视频)的能力。然而,随着输入复杂度的增加,尤其是长视频序列,所需标记数量显著增长,导致计算成本呈二次增长。这使得在保持性能完整性的前提下高效压缩 LMM 中的视频标记成为迫切的研究挑战。本文引入 CrossLMM,通过双重跨注意力机制将长视频序列与 LMM 解耦,显著减少视觉标记数量而性能几乎不变。具体而言,我们首先通过池化方法在预训练视觉编码器上实现显著的标记降维。随后,在 LLM 层内,我们采用视觉到视觉的跨注意力机制,其中池化后的视觉标记作为查询对抗原始视觉标记集合。该模块实现了更高效的标记利用,同时保留了细粒度信息保真度。此外,我们引入文本到视觉的跨注意力机制,文本标记通过与原始视觉标记互动得益增强,丰富了文本标记的视觉理解。全面实证评估表明,我们的方法在多样化基于视频的 LMM 基准测试中实现了与或优于现有方法的性能,却使用了大幅度的计算资源。
引用
@article{arxiv.2505.17020,
title = {CrossLMM: Decoupling Long Video Sequences from LMMs via Dual Cross-Attention Mechanisms},
author = {Shilin Yan and Jiaming Han and Joey Tsai and Hongwei Xue and Rongyao Fang and Lingyi Hong and Ziyu Guo and Ray Zhang},
journal= {arXiv preprint arXiv:2505.17020},
year = {2025}
}
备注
Project page: https://github.com/shilinyan99/CrossLMM