优化二维姿态表示:在无监督二维到三维人体姿态估计中提升精度、稳定性与泛化性
计算机视觉与模式识别
2022-09-02 v1
摘要
本文解决无监督二维到三维姿态提升过程中的二维姿态表示问题,以提升三维人体姿态估计(HPE)模型的精度、稳定性与泛化性。所有无监督二维-三维 HPE 方法在训练时均将完整的二维运动学骨架提供给模型。我们认为这是次优且具有破坏性的,因为在训练期间,独立的二维关键点与预测的三维坐标之间会引入长程关联。为此,我们开展了如下研究。在最大架构容量为 6 个残差块的条件下,我们评估了 5 个模型在对抗式无监督二维-三维 HPE 过程中以不同方式表示二维姿态的性能。此外,我们展示了训练过程中学习到的二维关键点间关联,凸显了当将完整二维姿态提供给提升模型时所引发的违背直觉的关联。我们的结果表明,二维姿态的最优表示方式是将躯干与腿部作为两个独立片段,且各提升网络间无共享特征。与参数数量近乎相同、训练于完整二维运动学骨架上的模型相比,该方法在 Human3.6M 数据集上将平均误差降低了 20%。此外,由于对抗式学习的复杂性,我们展示了这种表示方式如何也能改善训练期间的收敛,从而更常获得最优结果。
引用
@article{arxiv.2209.00618,
title = {Optimising 2D Pose Representation: Improve Accuracy, Stability and Generalisability Within Unsupervised 2D-3D Human Pose Estimation},
author = {Peter Hardy and Srinandan Dasmahapatra and Hansung Kim},
journal= {arXiv preprint arXiv:2209.00618},
year = {2022}
}
备注
arXiv admin note: text overlap with arXiv:2205.05980