基于神经渲染推动RGB单图稠密三维手姿估计的性能边界
计算机视觉与模式识别
2019-04-10 v2
摘要
从单张RGB图像估计三维手部网格具有挑战性,这源于固有的二维到三维映射歧义以及有限的训练数据。我们采用一种紧凑的参数化三维手部模型来表示可形变且有关节的手部网格。为实现模型对RGB图像的拟合,我们从三方面展开研究并做出贡献:1) 神经渲染:受近期人体相关工作的启发,我们的手部网格估计器(HME)由一个神经网络和一个可微渲染器实现,由二维分割掩码和三维骨架监督。HME在估计多样化手型方面表现出良好性能,并提升了姿态估计精度。2) 迭代测试精化:我们的拟合函数可微。我们借鉴ICP等迭代模型拟合方法的思想,利用梯度对初始估计进行迭代精化。该思路得到了最新人体研究的支持。3) 自数据增强:收集带尺寸的RGB-网格(或分割掩码)-骨架三元组用于训练是一大障碍。一旦模型成功拟合输入RGB图像,其网格(即形状与关节)便是逼真的,我们在估计出的稠密手部姿态之上增强视点。使用三个基于RGB的基准测试的实验表明,我们的框架在三维姿态估计上取得了超越SOTA的精度,并恢复了稠密的三维手型。上述每个技术组件在消融研究中均显著提升了精度。
引用
@article{arxiv.1904.04196,
title = {Pushing the Envelope for RGB-based Dense 3D Hand Pose Estimation via Neural Rendering},
author = {Seungryul Baek and Kwang In Kim and Tae-Kyun Kim},
journal= {arXiv preprint arXiv:1904.04196},
year = {2019}
}
备注
Accepted to CVPR 2019