中文

基于单目视频的自监督人体深度估计

计算机视觉与模式识别 2020-05-08 v1

摘要

以往估计精细人体深度的方法通常需要带“真实”深度数据的监督训练。本文提出一种自监督方法,可在无已知深度的 YouTube 视频上训练,使训练数据收集简便并提升所学网络的泛化能力。该自监督学习通过最小化光一致性损失实现,该损失在视频帧与其根据估计深度和人体三维非刚性运动扭曲的相邻帧之间进行评估。为解决此非刚性运动,我们首先在每视频帧估计粗略的 SMPL 模型并相应计算非刚性身体运动,从而实现估计形状细节的自监督学习。实验表明,我们的方法具有更好的泛化能力,并在真实场景数据中表现远优。

关键词

引用

@article{arxiv.2005.03358,
  title  = {Self-Supervised Human Depth Estimation from Monocular Videos},
  author = {Feitong Tan and Hao Zhu and Zhaopeng Cui and Siyu Zhu and Marc Pollefeys and Ping Tan},
  journal= {arXiv preprint arXiv:2005.03358},
  year   = {2020}
}

备注

Accepted by IEEE Conference on Computer Vision and Patten Recognition (CVPR), 2020