面向RGB-D图像中6D位姿估计的分析-合成学习
计算机视觉与模式识别
2015-08-20 v1
摘要
分析-合成(Analysis-by-synthesis)一直是计算机视觉中许多任务的成功方法,例如本工作主题——RGB-D图像中物体的6D位姿估计。其思想是将观测与前向过程的输出进行比较,例如感兴趣物体在特定位姿下的渲染图像。由于遮挡或复杂的传感器噪声,可能难以以有意义的方式进行此比较。我们提出一种“学习比较”的方法,同时考虑这些困难。这是通过用卷积神经网络(CNN)描述特定物体位姿的后验密度来实现的,该网络比较观测图像与渲染图像。网络以最大似然范式进行训练。我们通过经验观察到,CNN并不特化于特定物体的几何或外观,它可用于形状和外貌差异极大的物体,以及不同背景中。与最先进水平相比,我们在两个包含总共十一个物体、杂乱背景和严重遮挡的不同数据集上展示了显著改进。
引用
@article{arxiv.1508.04546,
title = {Learning Analysis-by-Synthesis for 6D Pose Estimation in RGB-D Images},
author = {Alexander Krull and Eric Brachmann and Frank Michel and Michael Ying Yang and Stefan Gumhold and Carsten Rother},
journal= {arXiv preprint arXiv:1508.04546},
year = {2015}
}
备注
16 pages, 8 figures