中文

MORE:同步多视角三维物体识别与位姿估计

机器人学 2023-04-10 v3

摘要

同步物体识别与位姿估计是机器人安全地与人类及环境交互的两个关键功能。尽管物体识别和位姿估计都使用视觉输入,但由于前者需要视角不变表示而物体位姿估计需要视角相关描述,大多数最先进方法将它们作为两个独立问题来处理。如今,多视角卷积神经网络(MVCNN)方法展现出最先进的分类性能。尽管 MVCNN 物体识别已被广泛探索,关于多视角物体位姿估计方法的研究很少,同时解决这两个问题的研究更少。MVCNN 方法中虚拟相机的位姿通常预先定义,导致此类方法的应用受限。在本文中,我们提出一种能够同时处理物体识别与位姿估计的方法。具体而言,我们开发了一种深度物体无关的熵估计模型,能够预测给定三维物体的最佳视角。然后将获得的物体视角输入网络,以同时预测目标物体的位姿和类别标签。实验结果表明,从这些位置获得的视角具有足够的描述性,可取得良好的准确率。此外,我们设计了一个真实生活中的倒饮料场景,以展示所提方法在真实机器人任务中的表现。代码可在 github.com/SubhadityaMukherjee/more_mvcnn 在线获取。

关键词

引用

@article{arxiv.2103.09863,
  title  = {MORE: Simultaneous Multi-View 3D Object Recognition and Pose Estimation},
  author = {Tommaso Parisotto and Subhaditya Mukherjee and Hamidreza Kasaei},
  journal= {arXiv preprint arXiv:2103.09863},
  year   = {2023}
}