从视频时空关系中自监督学习姿态嵌入
计算机视觉与模式识别
2017-08-08 v1
摘要
人体姿态分析目前由依赖大量关节位置等手动标注训练的深度卷积网络主导。为了避免昂贵标注的需求,我们利用训练视频中的时空关系进行姿态嵌入的自监督学习。核心思想是将时间排序和空间布局估计作为辅助任务,在 Siamese 卷积网络中学习姿态相似性。由于从自然视频中为这两个任务进行自监督采样可能会产生有歧义和不正确的训练标签,我们的方法采用了一种课程学习思想,从最可靠的数据样本开始训练,并逐渐增加难度。为了进一步优化训练过程,我们挖掘单个视频中的重复姿态,这些姿态提供可靠的标签,同时消除不一致性。我们的姿态嵌入捕捉了人体姿态的视觉特征,能够提升人体姿态估计和检索中现有的监督表示。我们在 Olympic Sports、Leeds Pose Sports 和 MPII Human Pose 数据集上报告了这些任务的定量和定性结果。
关键词
引用
@article{arxiv.1708.02179,
title = {Self-supervised Learning of Pose Embeddings from Spatiotemporal Relations in Videos},
author = {Ömer Sümer and Tobias Dencker and Björn Ommer},
journal= {arXiv preprint arXiv:1708.02179},
year = {2017}
}
备注
To appear in ICCV 2017