基于 RGB 的 3D 手部姿态估计:利用深度图像的优势学习
计算机视觉与模式识别
2018-11-20 v1
摘要
本文提出一种从 RGB 图像进行手部姿态估计的方法,该方法在训练时同时使用外部大规模深度图像数据集以及成对的深度与 RGB 图像作为优势信息。我们表明,在训练期间提供深度信息显著提升了测试时基于 RGB 图像的姿态估计性能。我们探索了利用该优势信息的不同方式:(1)使用深度数据初始训练基于深度的网络,(2)使用成对深度图像的基于深度网络的特征来约束中层 RGB 网络权重,以及(3)使用从深度数据获得的前景掩码来抑制背景区域的响应。通过使用成对的 RGB 和深度图像,我们能够监督基于 RGB 的网络学习中层特征以模仿在大规模、精确标注的深度数据上训练的对应基于深度网络的特征。在测试时,当仅有 RGB 图像可用时,我们的方法产生准确的 3D 手部姿态预测。我们的方法也在 2D 手部姿态估计上进行了测试。在三个公开数据集上的实验表明,该方法优于使用 RGB 图像输入的手部姿态估计的 SOTA 方法。
引用
@article{arxiv.1811.07376,
title = {RGB-based 3D Hand Pose Estimation via Privileged Learning with Depth Images},
author = {Shanxin Yuan and Bjorn Stenger and Tae-Kyun Kim},
journal= {arXiv preprint arXiv:1811.07376},
year = {2018}
}