基于骨架解耦表征的单目图像三维人体网格恢复
计算机视觉与模式识别
2019-09-18 v2
摘要
我们描述了一种从单张图像和单目视频中恢复三维人体网格的端到端方法。不同于现有方法试图从一个耦合特征中获取所有复杂的三维姿态、形状和相机参数,我们提出了一种基于骨架解耦的框架,以解耦方式将该任务划分到多层级空间与时间粒度上。在空间上,我们提出了一种有效且可插拔的“从细节中解耦骨架”(DSD)模块。它降低了复杂度并解耦了骨架,为时间建模奠定了良好基础。在时间上,提出了基于自注意力的时序卷积网络,以高效利用短期与长期时间线索。此外,设计了一种无监督对抗训练策略——时间打乱与顺序恢复,以促进运动动态的学习。所提方法在 Human3.6M 上以 15.4% MPJPE 和 23.8% PA-MPJPE 优于当前最优的(SOTA)三维人体网格恢复方法。在无需任何微调的情况下,于野外三维姿态(3DPW)数据集上也取得了当前最优结果。特别地,消融实验表明骨架解耦表征对于更好的时间建模与泛化能力至关重要。
引用
@article{arxiv.1908.07172,
title = {Human Mesh Recovery from Monocular Images via a Skeleton-disentangled Representation},
author = {Sun Yu and Ye Yun and Liu Wu and Gao Wenpeng and Fu YiLi and Mei Tao},
journal= {arXiv preprint arXiv:1908.07172},
year = {2019}
}
备注
Accepted by ICCV2019. The code is released at https://github.com/Arthur151/DSD-SATN