面向自监督对应学习的局部感知视频间与视频内重建
计算机视觉与模式识别
2022-03-30 v2
摘要
我们的目标是从无标签视频中学习视觉对应。我们提出了 LIIR,一个局部感知的视频间与视频内重建框架,它填补了自监督对应学习拼图中的三块缺失部分,即实例判别、位置感知和空间紧致性。首先,不同于现有多数工作仅关注视频内自监督,我们在统一的视频间与视频内重建方案中利用跨视频相似性作为额外的负样本。这通过对比期望的视频内像素关联与负的视频间对应,实现了实例判别表示学习。其次,我们将位置信息融入对应匹配,并设计了一种位置偏移策略以消除位置编码在视频间相似性计算中的副作用,使我们的 LIIR 具有位置敏感性。第三,为充分利用视频数据的空间连续性本质,我们对对应匹配施加基于紧致性的约束,从而得到更稀疏且可靠的求解。所学表示在包括物体、语义部件和关键点的标签传播任务上超越了自监督 SOTA。
引用
@article{arxiv.2203.14333,
title = {Locality-Aware Inter-and Intra-Video Reconstruction for Self-Supervised Correspondence Learning},
author = {Liulei Li and Tianfei Zhou and Wenguan Wang and Lu Yang and Jianwu Li and Yi Yang},
journal= {arXiv preprint arXiv:2203.14333},
year = {2022}
}
备注
CVPR 2022. Code: https://github.com/0liliulei/LIIR