视频中基于时序感知自监督学习的 3D 手部姿态与网格估计
计算机视觉与模式识别
2020-12-08 v1
摘要
直接从 RGB 图像估计 3D 手部姿态具有挑战性,但近期通过以标注 3D 姿态训练深度模型已取得稳步进展。然而,标注 3D 姿态十分困难,因此仅有少量 3D 手部姿态数据集可用,且样本量均有限。本研究提出一种无需使用显式 3D 标注(即仅以 2D 信息训练)从 RGB 图像训练 3D 姿态估计模型的新框架。我们的框架受两点观察启发:1) 相较于静态图像,视频为估计 3D 姿态提供了更丰富的信息;2) 无论以前向还是反向顺序观看视频,估计出的 3D 姿态应当一致。我们利用这两点观察开发了称为时序感知自监督网络(TASSN)的自监督学习模型。通过强制时序一致性约束,TASSN 仅以 2D 关键点位置标注从视频中学习 3D 手部姿态与网格。实验表明,我们的模型取得了令人惊讶的良好结果,其 3D 估计精度与以 3D 标注训练的当前最优(SOTA)模型相当,凸显了时序一致性在约束 3D 预测模型中的益处。
引用
@article{arxiv.2012.03205,
title = {Temporal-Aware Self-Supervised Learning for 3D Hand Pose and Mesh Estimation in Videos},
author = {Liangjian Chen and Shih-Yao Lin and Yusheng Xie and Yen-Yu Lin and Xiaohui Xie},
journal= {arXiv preprint arXiv:2012.03205},
year = {2020}
}