中文

用于单目人体网格恢复的合成训练

计算机视觉与模式识别 2020-10-28 v1

摘要

从单目图像恢复三维人体网格是计算机视觉中的热门话题,并具有广泛的应用。本文旨在从单张 RGB 图像估计具有大幅尺度差异的多个身体部位(例如身体、手)的三维网格。现有方法大多基于迭代优化,非常耗时。我们提出训练一个单阶段模型来实现此目标。主要挑战在于缺乏在二维图像中具有所有身体部位完整三维标注的训练数据。为解决该问题,我们设计了一个多分支框架来解耦不同身体属性的回归,使我们能够以合成训练方式利用可用的非配对数据分离各组件的训练。此外,为增强泛化能力,大多数现有方法已使用野外二维姿态数据集通过三维到二维投影来监督估计的三维姿态。然而,我们观察到常用的弱透视模型在处理相机投影的外部前缩效应时表现不佳。因此,我们提出深度到尺度(D2S)投影,将深度差异纳入投影函数以导出逐关节尺度变量,从而实现更恰当的监督。根据评估结果,所提方法在 CMU Panoptic Studio 数据集上优于先前方法,并在 Human3.6M 身体与 STB 手基准上取得可比结果。更令人印象深刻的是,使用所提 D2S 投影进行弱监督时,近景图像中的性能得到显著提升,同时保持明显的高效计算优势。

关键词

引用

@article{arxiv.2010.14036,
  title  = {Synthetic Training for Monocular Human Mesh Recovery},
  author = {Yu Sun and Qian Bao and Wu Liu and Wenpeng Gao and Yili Fu and Chuang Gan and Tao Mei},
  journal= {arXiv preprint arXiv:2010.14036},
  year   = {2020}
}