像素级回归:基于空间形式表示与可微解码器的三维手姿估计
计算机视觉与模式识别
2021-01-01 v2
摘要
从单张深度图像进行三维手姿估计是计算机视觉与人机交互中的重要课题。尽管深度学习方法兴起大幅提升了精度,但由于人手结构复杂,该问题仍难以解决。现有深度学习方法要么丢失手部结构的空间信息,要么缺乏对关节坐标的直接监督。本文提出一种新颖的像素级回归方法,利用空间形式表示(SFR)与可微解码器(DD)解决上述两个问题。为实现该方法,我们构建了一个模型,其中设计了特定的SFR及其相关的DD,将三维关节坐标分为平面坐标与深度坐标两部分,并分别使用平面回归(PR)与深度回归(DR)两个模块处理。我们通过消融实验表明,所提方法取得了优于以往方法的结果。我们还探究了不同训练策略如何影响学到的SFR与结果。在三个公开数据集上的实验表明,我们的模型与现有SOTA模型相当,且在其中一个数据集上可将平均三维关节误差降低25%。
引用
@article{arxiv.1905.02085,
title = {Pixel-wise Regression: 3D Hand Pose Estimation via Spatial-form Representation and Differentiable Decoder},
author = {Xingyuan Zhang and Fuhai Zhang},
journal= {arXiv preprint arXiv:1905.02085},
year = {2021}
}
备注
Update LaTeX version. Code coming soon