中文

使用中级视觉表示进行物体姿态估计

计算机视觉与模式识别 2022-03-04 v1 机器人学

摘要

本工作提出了一种可用于物体类别的姿态估计模型,能够有效迁移至先前未见过的环境。用于姿态估计的深度卷积网络模型(CNN)通常在专门为物体检测、姿态估计或 3D 重建策划的数据集上训练和评估,这需要大量训练数据。在本工作中,我们提出了一种可用少量数据训练、构建于通用中级表示 \cite{taskonomy2018}(例如表面法线估计和重新着色)之上的姿态估计模型。这些表示在大型数据集上训练,无需姿态和物体标注。随后,预测由一个利用物体掩码和轮廓检索的小型 CNN 神经网络细化。所提方法在 Pix3D 数据集 \cite{pix3d} 上取得了优越性能,并且在仅使用 25% 训练数据时,相比现有模型显示出近 35% 的提升。我们表明该方法在泛化和迁移至新环境方面具有优势。为此,我们在具有挑战性的 Active Vision Dataset \cite{Ammirato2017ADF} 上引入了一个针对常见家具类别的新姿态估计基准,并评估了在 Pix3D 数据集上训练的模型。

关键词

引用

@article{arxiv.2203.01449,
  title  = {Object Pose Estimation using Mid-level Visual Representations},
  author = {Negar Nejatishahidin and Pooya Fayyazsanavi and Jana Kosecka},
  journal= {arXiv preprint arXiv:2203.01449},
  year   = {2022}
}