学习从野外拥挤场景估计鲁棒的三维人体网格
计算机视觉与模式识别
2022-09-20 v3
摘要
我们考虑从野外拥挤场景恢复单人三维人体网格的问题。尽管三维人体网格估计已取得诸多进展,现有方法在测试输入含拥挤场景时表现不佳。失败的首要原因是训练与测试数据间的域差距。提供精确三维标签用于训练的运动捕捉数据集缺乏拥挤数据,阻碍网络学习目标人物的拥挤场景鲁棒图像特征。第二原因是特征处理对含多人的局部边界框特征图进行空间平均。对整个特征图平均使目标人物特征与他人不可区分。我们提出3DCrowdNet,首次显式针对野外拥挤场景,并通过解决上述问题估计鲁棒三维人体网格。首先,我们利用无需带三维标签运动捕捉数据集训练且不受域差距影响的二维人体姿态估计。其次,我们提出基于关节的回归器,区分目标人物特征与他人特征。我们的基于关节的回归器通过从目标关节位置采样特征并保持其空间激活,回归人体模型参数。因此,3DCrowdNet学习聚焦目标的特征,并有效排除邻近人物的无关特征。我们在多种基准上实验,从定量与定性上证明3DCrowdNet对野外拥挤场景的鲁棒性。代码见 https://github.com/hongsukchoi/3DCrowdNet_RELEASE。
引用
@article{arxiv.2104.07300,
title = {Learning to Estimate Robust 3D Human Mesh from In-the-Wild Crowded Scenes},
author = {Hongsuk Choi and Gyeongsik Moon and JoonKyu Park and Kyoung Mu Lee},
journal= {arXiv preprint arXiv:2104.07300},
year = {2022}
}
备注
Accepted to CVPR 2022, 16 pages including the supplementary material