从无标签视频中自监督学习可解释关键点
计算机视觉与模式识别
2020-12-24 v2
摘要
我们提出 KeypointGAN,一种从单幅图像识别物体姿态的新方法,其在学习中仅使用无标签视频和关于物体姿态的弱经验先验。视频帧的差异主要在于其所含物体的姿态,因此我们的方法通过分析帧间差异来提炼姿态信息。该提炼采用物体几何的一种新双重表示:一组 2D 关键点,以及一种图像化表示(即骨架图像)。这有三方面好处:(1) 它提供了一个紧密的“几何瓶颈”,将姿态与外观解耦;(2) 它能利用强大的图像到图像翻译网络在光度与几何之间映射;(3) 它允许在学习过程中融入经验姿态先验。姿态先验来自未配对数据,例如来自不同数据集或模态(如动作捕捉),从而在学习姿态识别网络时从未使用过任何标注图像。在人与人脸姿态识别的标准基准中,我们的方法在无需任何标注图像训练的方法中达到了最先进性能。
引用
@article{arxiv.1907.02055,
title = {Self-supervised Learning of Interpretable Keypoints from Unlabelled Videos},
author = {Tomas Jakab and Ankush Gupta and Hakan Bilen and Andrea Vedaldi},
journal= {arXiv preprint arXiv:1907.02055},
year = {2020}
}
备注
CVPR 2020 (oral). Project page: http://www.robots.ox.ac.uk/~vgg/research/unsupervised_pose/