中文

基于状态空间模型的几何感知视频运动放大

计算机视觉与模式识别 2026-05-29 v1

摘要

视频运动放大 (VMM) 揭示了难以察觉的动态,但在复杂几何变换下常常出现结构不一致。现有的基于学习的方法通常在 CNN 的全局上下文有限性与 Transformer 的高计算成本之间受制于权衡。此外,当前的训练协议主要由简单线性运动主导,未能捕捉现实视频中遇到的几何和成像复杂性。为此,我们提出 GeoMag,一个基于状态空间模型构建的几何感知 VMM 框架,以实现全局一致的运动放大和线性复杂度。我们进一步构建 Geo-200K,一个大规模合成数据集,引入丰富的几何变换并伴随传感器级现实退化,提高了训练信号的多样性和真实性。在合成和真实基准上的大量实验表明,GeoMag 在视觉保真度和计算效率方面 consistently 超过先前方法,同时产生更少的伪影并实现更好的结构一致性。

关键词

引用

@article{arxiv.2605.29762,
  title  = {GeoMag: Geometric-Aware Video Motion Magnification via State Space Model},
  author = {Kecheng Han and Yuchen Zhang and Bingqing Liu and Boqiang Guo and Wenbin Zheng and Shiyuan Pei},
  journal= {arXiv preprint arXiv:2605.29762},
  year   = {2026}
}

备注

ICME 2026 Spotlight