中文

跨域物体位姿估计的多路径学习方法

计算机视觉与模式识别 2020-04-06 v2 机器学习

摘要

我们提出了一种可扩展的物体位姿估计方法,其训练数据为多个3D模型在一起的模拟RGB视图。我们学习了一种物体视图的编码,它不仅描述了训练期间所见所有物体的隐式朝向,还能关联未训练物体的视图。我们的单编码器-多解码器网络使用一种我们称为“多路径学习”的技术进行训练:编码器由所有物体共享,而每个解码器仅重建单个物体的视图。因此,不同实例的视图不必在潜空间中分离,可以共享共同特征。所得到的编码器在从合成数据到真实数据以及跨各种实例、类别、模型类型和数据集上均具有良好泛化能力。我们在ModelNet40和T-LESS数据集上系统研究了所学编码、其泛化能力以及迭代优化策略。尽管在多个物体上联合训练,我们的6D物体检测流程在T-LESS上以远低于竞争方法的运行时间取得了最先进(state-of-the-art)结果。

关键词

引用

@article{arxiv.1908.00151,
  title  = {Multi-path Learning for Object Pose Estimation Across Domains},
  author = {Martin Sundermeyer and Maximilian Durner and En Yen Puang and Zoltan-Csaba Marton and Narunas Vaskevicius and Kai O. Arras and Rudolph Triebel},
  journal= {arXiv preprint arXiv:1908.00151},
  year   = {2020}
}

备注

To appear at CVPR 2020; Code will be available here: https://github.com/DLR-RM/AugmentedAutoencoder/tree/multipath