中文

打破捷径:探索用于视频对应学习的全卷积循环一致性

计算机视觉与模式识别 2021-12-30 v2

摘要

以往的循环一致性对应学习方法通常利用图像块进行训练。本文提出一种全卷积方法,其更简单且与推理过程更一致。虽然直接应用全卷积训练会导致模型崩溃,我们研究了该崩溃现象背后的深层原因,指出像素的绝对位置提供了一条轻易达成循环一致性的捷径,阻碍了有意义视觉表示的学习。为打破这一绝对位置捷径,我们提出对前向与后向帧施加不同裁剪,并采用特征扭曲在同一帧的两个裁剪间建立对应。前一技术迫使前向与后向轨迹上的对应像素具有不同绝对位置,后一技术有效阻断了前向与后向轨迹间通行的捷径。在姿态跟踪、人脸关键点跟踪和视频目标分割三个标签传播基准上,我们的方法大幅改进了朴素全卷积循环一致性方法的结果,与自监督最优方法相比取得了极具竞争力的性能。我们的训练模型和代码发布于 \url{https://github.com/Steve-Tod/STFC3}。

关键词

引用

@article{arxiv.2105.05838,
  title  = {Breaking Shortcut: Exploring Fully Convolutional Cycle-Consistency for Video Correspondence Learning},
  author = {Yansong Tang and Zhenyu Jiang and Zhenda Xie and Yue Cao and Zheng Zhang and Philip H. S. Torr and Han Hu},
  journal= {arXiv preprint arXiv:2105.05838},
  year   = {2021}
}

备注

ICCV 2021 SRVU workshop