中文

MAVFusion:基于运动感知稀疏交互的红外和可见视频融合

计算机视觉与模式识别 2026-04-03 v1

摘要

红外和可见视频融合结合了红外图像的对象显著性和可见图像的纹理细节,生成富含语义信息的融合结果。然而,大多数现有方法针对静态图像设计,无法有效处理视频中的帧间运动。当前的视频融合方法通过引入跨帧交互来提高时序一致性,但往往计算成本高昂。为缓解这些挑战,我们提出了 MAVFusion,一个具有运动感知稀疏交互机制的端到端视频融合框架,在保持卓越融合质量的同时提高效率。具体而言,我们利用光流识别多模态序列中的动态区域,自适应分配跨模态注意力计算资源以捕获显著过渡并促进模态间信息交换。对于静态背景区域,采用轻量级弱交互模块维持结构和外观完整性。通过解耦动态和静态区域的处理,MAVFusion 在显著加速推理的同时,同时保持时序一致性和细粒度细节。广泛的实验表明,MAVFusion 在多个红外和可见视频基准上实现了最前沿的性能,分辨率 640×480640 \times 480 时速度达到 14.16 FPS。源代码将于 https://github.com/ixilai/MAVFusion 发布。

关键词

引用

@article{arxiv.2604.01958,
  title  = {MAVFusion: Efficient Infrared and Visible Video Fusion via Motion-Aware Sparse Interaction},
  author = {Xilai Li and Weijun Jiang and Xiaosong Li and Yang Liu and Hongbin Wang and Tao Ye and Huafeng Li and Haishu Tan},
  journal= {arXiv preprint arXiv:2604.01958},
  year   = {2026}
}