中文

DUT:仅通过观看不稳定视频学习视频稳像

计算机视觉与模式识别 2022-06-10 v3

摘要

先前基于深度学习的视频稳像器需要大规模配对的稳定与不稳定视频用于训练,而这类数据难以收集。另一方面,传统的基于轨迹的稳像器将任务划分为若干子任务并依次处理,在使用手工特征时于无纹理与遮挡区域表现脆弱。在本文中,我们尝试以深度无监督学习的方式解决视频稳像问题,其借鉴了传统稳像器的分而治之思想,同时利用 DNN 的表征能力应对真实场景中的挑战。技术上,DUT 由轨迹估计阶段与轨迹平滑阶段组成。在轨迹估计阶段,我们首先估计关键点运动,通过一种新颖的多单应性估计策略与运动细化网络分别初始化并细化网格运动,并通过时间关联获得基于网格的轨迹。在轨迹平滑阶段,我们设计了一种新颖的网络来预测动态平滑核以进行轨迹平滑,其能良好适应具有不同动态模式的轨迹。我们利用关键点与网格顶点的空间和时间一致性来构建训练目标,从而形成一种无监督训练方案。在公开基准上的实验结果表明,DUT 在定性与定量上均优于最先进的方法。源代码见 https://github.com/Annbless/DUTCode。

关键词

引用

@article{arxiv.2011.14574,
  title  = {DUT: Learning Video Stabilization by Simply Watching Unstable Videos},
  author = {Yufei Xu and Jing Zhang and Stephen J. Maybank and Dacheng Tao},
  journal= {arXiv preprint arXiv:2011.14574},
  year   = {2022}
}