中文

MambaVF:基于状态空间模型的高效视频融合

计算机视觉与模式识别 2026-02-06 v1

摘要

视频融合是各种视频处理任务中的基本技术。然而,现有的视频融合方法高度依赖光流估计和特征配准,导致计算开销严重且可扩展性有限。本文提出MambaVF,一种基于状态空间模型(SSMs)的高效视频融合框架,通过无显式运动估计进行时间建模。首先,通过将视频融合重新表述为顺序状态更新过程,MambaVF以线性复杂度捕获长程时间依赖,显著降低计算和内存成本。其次,MambaVF提出一种轻量级基于SSM的融合模块,用以取代常规的flow引导对齐方式,通过时空双向扫描机制实现。该模块 enables 跨帧的信息高效聚合。广泛的实验在多个基准上表明,我们的MambaVF在多曝光、多焦点、红外-可见以及医学视频融合任务中实现了最先进的性能。我们强调,MambaVF具有高效性,在参数减少最高达92.25%,计算FLOPs减少88.79%,相较于现有方法实现2.1倍的加速。项目页面:https://mambavf.github.io

关键词

引用

@article{arxiv.2602.06017,
  title  = {MambaVF: State Space Model for Efficient Video Fusion},
  author = {Zixiang Zhao and Yukun Cui and Lilun Deng and Haowen Bai and Haotong Qin and Tao Feng and Konrad Schindler},
  journal= {arXiv preprint arXiv:2602.06017},
  year   = {2026}
}