中文

用于自监督对应学习的对比变换

计算机视觉与模式识别 2020-12-10 v1

摘要

本文关注利用无标注自然视频进行视觉对应关系的自监督学习。我们的方法同时考虑帧内与帧间视频的表示关联,以实现可靠的对应估计。帧内学习通过单视频内帧对亲和度跨帧变换图像内容。为获得用于实例级区分的判别性表示,我们超越帧内分析,构建帧间亲和度以促进跨不同视频的对比变换。通过强制帧内与帧间层级间的变换一致性,细粒度对应关联得以良好保持,实例级特征判别性也得到有效增强。我们的简洁框架在一系列视觉任务上优于近期自监督对应方法,包括视频目标跟踪(VOT)、视频目标分割(VOS)、姿态关键点跟踪等。值得一提的是,我们的方法也超越了全监督亲和度表示(如ResNet),并与近期针对特定任务(如VOT和VOS)设计的全监督算法性能相当。

关键词

引用

@article{arxiv.2012.05057,
  title  = {Contrastive Transformation for Self-supervised Correspondence Learning},
  author = {Ning Wang and Wengang Zhou and Houqiang Li},
  journal= {arXiv preprint arXiv:2012.05057},
  year   = {2020}
}

备注

To appear in AAAI 2021