VMRNN:融合视觉 Mamba 与 LSTM 实现高效精准的时空预测
计算机视觉与模式识别
2024-07-02 v3
摘要
将 CNN 或 ViT 与 RNN 结合用于时空预测,在预测时间和空间动态方面已取得无与伦比的成果。然而,建模广泛的全局信息仍是一项艰巨挑战:CNN 受限于其狭窄的感受野,而 ViT 则因其注意力机制的高计算需求而难以应对。近期基于 Mamba 架构的出现因其卓越的长序列建模能力而备受关注,在效率和精度上超越了现有的视觉模型,这促使我们开发一种专为时空预测量身定制的创新架构。本文提出了 VMRNN 单元,这是一种融合了 Vision Mamba 模块与 LSTM 优势的新型循环单元。我们构建了一个以 VMRNN 单元为核心的网络,以有效处理时空预测任务。广泛的评估表明,我们提出的方法在多种任务上取得了具有竞争力的结果,同时保持了较小的模型规模。代码见 https://github.com/yyyujintang/VMRNN-PyTorch。
引用
@article{arxiv.2403.16536,
title = {VMRNN: Integrating Vision Mamba and LSTM for Efficient and Accurate Spatiotemporal Forecasting},
author = {Yujin Tang and Peijie Dong and Zhenheng Tang and Xiaowen Chu and Junwei Liang},
journal= {arXiv preprint arXiv:2403.16536},
year = {2024}
}
备注
CVPR2024 Precognition Workshop