单目视频上用于三维人体姿态估计的时间表示学习
计算机视觉与模式识别
2022-11-28 v5 机器学习
摘要
在本文中,我们提出一种无监督特征提取方法以捕获单目视频上的时间信息,其中我们检测并编码每帧中感兴趣主体,并利用对比自监督(CSS)学习提取丰富隐向量。不同于其他 CSS 方法简单地将邻近帧的隐特征视为正对、将时间上远离的帧的隐特征视为负对,我们显式地将每个隐向量解耦为时间变化分量与时间不变分量。接着我们表明,仅对时间变化特征施加对比损失,并鼓励它们在邻近与远离帧间逐渐过渡,同时重建输入,可提取丰富的时间特征,非常适于人体姿态估计。与标准 CSS 策略相比,我们的方法将误差降低约 50%,优于其他无监督单视图方法,并匹配多视图技术的性能。当 2D 姿态可用时,我们的方法可提取更丰富的隐特征并提升三维姿态估计精度,优于其他最先进的弱监督方法。
引用
@article{arxiv.2012.01511,
title = {Temporal Representation Learning on Monocular Videos for 3D Human Pose Estimation},
author = {Sina Honari and Victor Constantin and Helge Rhodin and Mathieu Salzmann and Pascal Fua},
journal= {arXiv preprint arXiv:2012.01511},
year = {2022}
}
备注
Accepted in "IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)"