中文

基于多级同构架构的运动放大频率解耦

计算机视觉与模式识别 2024-03-26 v2

摘要

视频运动放大 (VMM) 旨在揭示宏观世界中物体细微且不可察觉的运动信息。先前的方法通过表示学习分离形状和纹理,或通过相位波动的多域学习,直接从欧拉视角建模运动场。受频谱启发,我们观察到具有稳定能量的低频分量始终拥有空间结构且噪声较少,使其适合建模细微运动场。为此,我们提出了 FD4MM,这是一种用于运动放大的频率解耦新范式,采用多级同构架构来捕捉视频空间中的多级高频细节和稳定的低频结构(运动场)。由于高频细节和细微运动因其固有的细微性以及不可避免的外部噪声干扰而易受信息退化影响,我们精心设计了稀疏高通/低通滤波器以增强细节和运动结构的完整性,并设计了稀疏频率混合器以促进无缝重耦合。此外,我们创新性地为该任务设计了对比正则化,以增强模型区分无关特征的能力,减少不必要的运动放大。在真实世界和合成数据集上的大量实验表明,我们的 FD4MM 优于 SOTA 方法。同时,与最新方法相比,FD4MM 将 FLOPs 降低了 1.63×\times,并将推理速度提高了 1.68×\times。我们的代码可在 https://github.com/Jiafei127/FD4MM 获取。

关键词

引用

@article{arxiv.2403.07347,
  title  = {Frequency Decoupling for Motion Magnification via Multi-Level Isomorphic Architecture},
  author = {Fei Wang and Dan Guo and Kun Li and Zhun Zhong and Meng Wang},
  journal= {arXiv preprint arXiv:2403.07347},
  year   = {2024}
}

备注

Accepted by CVPR2024