中文

AuroraLong: 将 RNN 引入高效的开放式视频理解

计算机视觉与模式识别 2025-07-24 v3

摘要

长视频理解的挑战在于其高计算复杂度和高昂的内存成本,因为基于 transformer 的大语言模型(LLM)所需的内存和计算随输入序列长度呈二次增长。我们提出 AuroraLong 通过替换 MLLMs 中的 LLM 组件,采用能够处理任意长度输入且保持常数大小隐藏状态的线性 RNN 语言模型,以此来解决上述挑战。为进一步提高吞吐量和效率,我们将视觉 token 合并与线性 RNN 模型结合,通过将视觉 token 按大小升序排序来实现。尽管仅使用 20 亿参数且仅在公开数据上进行训练,AuroraLong 在多个视频基准测试中达到了与规模相似的基于 Transformer 模型相当的性能,这些模型是在私有数据集上训练的。这表明了利用高效的线性 RNN 来 democratize 长视频理解的潜力,从而降低了其计算进入门槛。在我们意识到的情况下,我们是首次在类似 LLaVA 的模型中使用基于线性 RNN 的 LLM 骨干网络进行开放式视频理解。

关键词

引用

@article{arxiv.2507.02591,
  title  = {AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding},
  author = {Weili Xu and Enxin Song and Wenhao Chai and Xuexiang Wen and Tian Ye and Gaoang Wang},
  journal= {arXiv preprint arXiv:2507.02591},
  year   = {2025}
}

备注

ICCV 2025 Camera Ready