中文

运动捕捉的自监督学习

计算机视觉与模式识别 2017-12-06 v1

摘要

当前单相机运动捕捉的最优解是基于优化的:它们优化三维人体模型的参数,使其重投影与视频中的测量值(如人体分割、光流、关键点检测等)相匹配。优化模型易陷入局部极小。这一瓶颈迫使人们在捕捉时使用干净的绿幕类背景、手动初始化,或改用多相机作为输入。本文提出一种基于学习的单相机输入运动捕捉模型。我们的模型不直接优化网格与骨架参数,而是优化神经网络权重,以在给定单目 RGB 视频时预测三维形状与骨架构型。我们的模型在端到端框架中,结合来自合成数据的强监督,以及来自(a)骨架关键点、(b)稠密三维网格运动、(c)人体-背景分割的可微渲染的自监督进行训练。实验上,我们表明我们的模型结合了监督学习与测试时优化两方面的优势:监督学习以正确方式初始化模型参数,确保测试时无需人工干预即可获得良好的姿态与表面初始化。通过可微渲染反向传播的自监督允许模型(无监督地)适应测试数据,并提供比预训练固定模型紧密得多的拟合。我们展示了所提模型随经验改进,并收敛到此前优化方法失败处的低误差解。

关键词

引用

@article{arxiv.1712.01337,
  title  = {Self-supervised Learning of Motion Capture},
  author = {Hsiao-Yu Fish Tung and Hsiao-Wei Tung and Ersin Yumer and Katerina Fragkiadaki},
  journal= {arXiv preprint arXiv:1712.01337},
  year   = {2017}
}

备注

Neural Information Processing Systems (NIPS) 2017