重新审视基于学习的视频运动放大以实现实时处理
计算机视觉与模式识别
2024-03-05 v1 图像与视频处理
摘要
视频运动放大是一种捕捉并放大视频中裸眼不可见微小运动的技术。先前基于深度学习的工作成功展示了对运动放大问题的建模,与传统基于信号处理的方法相比具有出色的质量。然而,其仍落后于实时性能,这阻碍了其向各种在线应用的扩展。在本文中,我们研究了一种高效的基于深度学习的运动放大模型,该模型可对全高清分辨率视频进行实时处理。由于现有技术的特定网络设计(即非均匀架构),直接应用现有的神经架构搜索方法十分复杂。我们未采用自动搜索,而是逐模块地仔细研究了架构在运动放大任务中的作用和重要性。两个关键发现是:1) 降低解码器中潜在运动表示的空间分辨率,在计算效率和任务质量之间提供了良好的折衷;2) 令人惊讶的是,编码器中仅使用单一线性层和单分支便足以完成运动放大任务。基于这些发现,我们引入了一种实时基于深度学习的运动放大模型,其 FLOPs 减少了 4.2 倍,速度比现有技术快 2.7 倍,同时保持了可比的质量。
引用
@article{arxiv.2403.01898,
title = {Revisiting Learning-based Video Motion Magnification for Real-time Processing},
author = {Hyunwoo Ha and Oh Hyun-Bin and Kim Jun-Seong and Kwon Byung-Ki and Kim Sung-Bin and Linh-Tam Tran and Ji-Yun Kim and Sung-Ho Bae and Tae-Hyun Oh},
journal= {arXiv preprint arXiv:2403.01898},
year = {2024}
}
备注
19 pages