中文

VideoNSA:原生稀疏注意力扩展视频理解能力

计算机视觉与模式识别 2026-02-02 v2 人工智能 机器学习

摘要

多模态语言模型中的视频理解能力受限于上下文长度:模型常常错过关键转折帧,难以在长时间尺度上保持连贯性。为此,我们将原生稀疏注意力(NSA)应用于视频语言模型。我们的方法 VideoNSA 通过在 216K 视频指令数据集上进行端到端训练,对 Qwen2.5-VL 进行适配。我们采用硬件感知的混合注意力方法,保留文本的稠密注意力,同时对视频采用 NSA。与 token 压缩和训练-free 稀疏基线方法相比,VideoNSA 在长视频理解、时序推理和空间基准测试中实现了 improved performance。进一步的消融分析揭示了四个关键发现:(1) 可靠地扩展到 128K token;(2) 在固定预算下的全局-局部注意力配置最优;(3) 任务相关的分支使用模式;(4) 可学习的组合稀疏注意力有助于诱导动态注意力汇。项目页面:https://enxinsong.com/VideoNSA-web/,代码:https://github.com/Espere-1119-Song/VideoNSA

关键词

引用

@article{arxiv.2510.02295,
  title  = {VideoNSA: Native Sparse Attention Scales Video Understanding},
  author = {Enxin Song and Wenhao Chai and Shusheng Yang and Ethan Armand and Xiaojun Shan and Haiyang Xu and Jianwen Xie and Zhuowen Tu},
  journal= {arXiv preprint arXiv:2510.02295},
  year   = {2026}
}

备注

ICLR 2026