中文

基于社交媒体视频的着装人体自监督三维表征学习

计算机视觉与模式识别 2022-12-29 v3

摘要

学习着装人体三维高保真几何的视觉表征的一个关键挑战在于真实标注数据(如三维扫描模型)的有限可用性,这导致在应用于真实世界图像时三维人体重建性能下降。我们通过利用一种新的数据资源来解决这一挑战:大量社交媒体舞蹈视频,其涵盖多样的外观、服装风格、表演与身份。每个视频描绘单个人体及衣物的动态运动,但缺乏三维真实几何标注。为从这些视频中学习视觉表征,我们提出一种新的自监督学习方法,利用局部变换将人在某一图像中预测出的局部几何扭曲至另一不同时刻图像的局部几何。这通过强制预测上的时间一致性来实现自监督。此外,我们联合学习深度与表面法线,后者对局部纹理、褶皱和阴影高度敏感,通过最大化其几何一致性来实现。我们的方法是端到端可训练的,产生高保真深度估计,预测出忠实于输入真实图像的精细几何。我们进一步通过不确定性分析给出自监督学习的理论界,刻画了无需训练的自监督学习性能。我们证明,在真实与渲染图像上,我们的方法优于最先进的人体深度估计与人体形状恢复方法。

关键词

引用

@article{arxiv.2103.03319,
  title  = {Self-supervised 3D Representation Learning of Dressed Humans from Social Media Videos},
  author = {Yasamin Jafarian and Hyun Soo Park},
  journal= {arXiv preprint arXiv:2103.03319},
  year   = {2022}
}