从 RGB 图像学习估计手持物体的位姿与形状
计算机视觉与模式识别
2019-11-12 v3
摘要
我们开发了一个系统,用于从显示手握已知类别新物体的 RGB 图像中进行 3D 手物交互建模。我们设计了一个用于手持物体位姿与形状估计的卷积神经网络 (CNN),称为 HOPS-Net,并利用先前的工作来估计手的位姿和形态。我们利用了关于手的信息有助于物体位姿和形状估计这一洞察,将手的信息结合到物体位姿与形状的训练和推断以及估计位姿的优化过程中。该网络在一个包含物体与人手交互的大型合成数据集上进行训练。为了弥合真实图像与合成图像之间的差距,我们采用了一个图像到图像转换模型 (Augmented CycleGAN),在给定合成渲染的情况下生成具有真实纹理的物体。这提供了一种可扩展的生成标注数据的方法,用于训练 HOPS-Net。我们的定量实验表明,即使是带有噪声的手部参数也能显著帮助物体位姿和形状估计。定性实验展示了对手“在自然环境中”所持物体进行位姿和形状估计的结果。
引用
@article{arxiv.1903.03340,
title = {Learning to Estimate Pose and Shape of Hand-Held Objects from RGB Images},
author = {Mia Kokic and Danica Kragic and Jeannette Bohg},
journal= {arXiv preprint arXiv:1903.03340},
year = {2019}
}