中文

用于视频无监督学习的多网格预测滤波流

计算机视觉与模式识别 2019-04-04 v1

摘要

我们引入多网格预测滤波流(mgPFF),一种用于视频无监督学习的框架。mgPFF 以一对帧为输入,输出逐像素滤波器将一帧扭曲至另一帧。相较于用于帧扭曲的光流,mgPFF 在建模亚像素运动与处理退化(如运动模糊)方面更强大。我们开发了多网格由粗到细建模策略,避免学习大滤波器以捕捉大位移的需求。这使我们能训练一个极紧凑的模型(4.6MB),以共享权重在多种分辨率上渐进式运作。我们在无监督自由形式视频上训练 mgPFF,并显示 mgPFF 不仅能估计用于帧重建的长程流与检测视频镜头切换,还可轻易适配视频目标分割与姿态跟踪,无需额外技巧即大幅超越已发表的 SOTA。此外,得益于 mgPFF 逐像素滤波器预测的特性,我们拥有独特机会可视化每个像素在解决这些任务时的演化,从而获得更好的可解释性。

关键词

引用

@article{arxiv.1904.01693,
  title  = {Multigrid Predictive Filter Flow for Unsupervised Learning on Videos},
  author = {Shu Kong and Charless Fowlkes},
  journal= {arXiv preprint arXiv:1904.01693},
  year   = {2019}
}

备注

webpage (https://www.ics.uci.edu/~skong2/mgpff.html)