InfiniteVL: synergizing 线性注意力与稀疏注意力构建高度效率、无限输入视觉语言模型
计算机视觉与模式识别
2026-04-01 v2 人工智能
摘要
视觉语言模型(VLMs)正日益被要求进行超长多模态理解。虽然线性架构具有恒定的计算和内存占用,但常常在高频率视觉感知方面不足以与标准 Transformer 相抗衡。为弥合这一差距,我们引入了 \textbf{InfiniteVL}。我们首先开发了一种混合基础模型 \textbf{InfiniteVL-Base},将少量的全注意力层与 Gated DeltaNet 交错。凭借量身定制的蒸馏和微调策略,InfiniteVL-Base 在保持基本多模态性能的同时,实现了 \textbf{1.7倍}的解码加速。然而,保留的全注意力的二次复杂度在扩展到超长上下文时必然成为效率瓶颈。为突破这一障碍,我们提出了一种新颖的长序列架构微调策略,使稠密注意力无缝转化为面向视觉的稀疏机制。这产生了两种专业变体:\textbf{InfiniteVL-Offline} 用于离线检索,\textbf{InfiniteVL-Online} 用于在线流式处理。通过消除全局注意力的计算爆炸而不牺牲高频率视觉召回能力,InfiniteVL-Offline 实现了 Transformer 级的长度泛化,\textbf{5倍}的预填充加速;Concurrently,InfiniteVL-Online 提供了恒定内存占用的稳健流式感知,实现 \textbf{25 FPS} 的实时吞吐。代码和模型可在 https://github.com/hustvl/InfiniteVL 提供。
引用
@article{arxiv.2512.08829,
title = {InfiniteVL: Synergizing Linear and Sparse Attention for Highly-Efficient, Unlimited-Input Vision-Language Models},
author = {Hongyuan Tao and Bencheng Liao and Shaoyu Chen and Haoran Yin and Qian Zhang and Wenyu Liu and Xinggang Wang},
journal= {arXiv preprint arXiv:2512.08829},
year = {2026}
}
备注
20 pages, 8 figures, conference or other essential info