中文

从静态图像中进行自监督运动学习

计算机视觉与模式识别 2021-04-02 v1

摘要

运动在视频中体现为像素的移动,而动作本质上是前景与背景之间不一致运动的模式。为了很好地区分动作,尤其是那些具有复杂时空交互的动作,正确定位显著运动区域至关重要。然而,现有视频中的大部分运动信息难以标注,因此用监督方式训练具有良好运动表示的模型将需要大量人工标注。本文通过自监督学习来解决这一问题。具体而言,我们提出从静态图像中学习运动(MoSI)。该模型通过对 MoSI 生成的伪运动进行分类来学习编码运动信息。我们进一步在伪运动中引入静态掩码以创建局部运动模式,这迫使模型额外定位显著运动区域以正确分类。我们证明,即使不在下游数据集上微调,MoSI 也能发现具有大幅运动的区域。因此,所学到的运动表示提升了需要理解复杂场景与运动的任务(即动作识别)的性能。大量实验表明 MoSI 取得了持续且可迁移的提升。代码将很快发布。

关键词

引用

@article{arxiv.2104.00240,
  title  = {Self-supervised Motion Learning from Static Images},
  author = {Ziyuan Huang and Shiwei Zhang and Jianwen Jiang and Mingqian Tang and Rong Jin and Marcelo Ang},
  journal= {arXiv preprint arXiv:2104.00240},
  year   = {2021}
}

备注

To appear in CVPR 2021