中文

基于动态间隔三元组损失的3D物体实例识别与位姿估计

计算机视觉与模式识别 2019-04-11 v1 机器人学

摘要

本文中,我们解决了在杂乱环境中利用卷积神经网络进行3D物体实例识别与已定位物体位姿估计的问题。受Wohlhart等人描述子学习方法的启发,我们提出了一种在流形学习三元组损失函数中引入动态间隔的方法。该损失函数旨在将不同物体在不同位姿下的图像映射到一个低维、保持相似性的描述子空间,从而可应用高效的最近邻搜索算法。引入动态间隔可加快训练速度并提高所得低维流形的精度。此外,我们做出了以下贡献:在训练中加入了平面内旋转(基线方法忽略了该因素),提出了新的背景噪声类型以更好地模拟真实场景并提升在杂乱环境下的精度,将表面法线作为另一种表示物体表面的强大图像模态,其性能优于仅使用深度信息,以及最终实现了高效的在线批次生成,从而在训练阶段提供更好的可变性。我们进行了详尽的评估以证明各项贡献的效果。另外,我们在大型BigBIRD数据集上评估了该算法的性能,以展示该流程在模型数量方面的良好可扩展性。

关键词

引用

@article{arxiv.1904.04854,
  title  = {3D Object Instance Recognition and Pose Estimation Using Triplet Loss with Dynamic Margin},
  author = {Sergey Zakharov and Wadim Kehl and Benjamin Planche and Andreas Hutter and Slobodan Ilic},
  journal= {arXiv preprint arXiv:1904.04854},
  year   = {2019}
}