提升3D人体姿态估计的鲁棒性:基准与从噪声输入中学习
计算机视觉与模式识别
2024-04-17 v2
摘要
尽管当前的3D人体姿态估计技术取得了可喜的性能,但理解并增强其在具有挑战性的真实视频上的泛化能力仍是一个开放问题。在本工作中,我们关注2D到3D姿态提升器的鲁棒性。为此,我们开发了两个基准数据集,即Human3.6M-C和HumanEva-I-C,以检验基于视频的3D姿态提升器对各种常见视频损坏的鲁棒性,包括临时遮挡、运动模糊和像素级噪声。我们观察到最先进的3D姿态提升器在存在损坏时泛化能力较差,并建立了两种技术来解决这一问题。首先,我们引入了时间加性高斯噪声(TAGN)作为一种简单而有效的2D输入姿态数据增强方法。此外,为了结合2D姿态检测器输出的置信度分数,我们设计了一个置信度感知卷积(CA-Conv)模块。在损坏视频上的广泛测试表明,所提出的策略持续提升了3D姿态提升器的鲁棒性,并可作为未来研究的新基准。
引用
@article{arxiv.2312.06797,
title = {Improving the Robustness of 3D Human Pose Estimation: A Benchmark and Learning from Noisy Input},
author = {Trung-Hieu Hoang and Mona Zehni and Huy Phan and Duc Minh Vo and Minh N. Do},
journal= {arXiv preprint arXiv:2312.06797},
year = {2024}
}