面向密集场景中基于深度的6D物体姿态与联合配准的多任务深度网络
计算机视觉与模式识别
2018-06-12 v1
摘要
在箱拣选场景中,感兴趣物体的多个实例随机堆叠在一起,因此这些实例固有地面临以下挑战:严重遮挡、杂乱以及外观相似的干扰物。然而,现有大多数方法针对的是单个孤立物体实例,而一些近期方法将密集场景作为考虑多物体关系的后细化步骤来处理。在本文中,我们通过深度神经网络中的多任务学习,解决了在深度模态下恢复箱拣选场景中多个实例6D姿态的问题。我们的架构联合学习多个子任务:单个物体的2D检测、深度与3D姿态估计;以及多个物体的联合配准。为了生成训练数据,通过3D物体模型在物理仿真中生成物理上合理的物体姿态配置的深度图像,从而产生多样的遮挡模式以供学习。我们采用了最先进的物体检测器,并通过网络进一步估计2D偏移量以细化错位的2D检测结果。深度与3D姿态估计器被设计为针对每次检测生成多个假设。这使得联合配准网络能够学习遮挡模式并移除物理上不合理的姿态假设。我们将我们的架构应用于合成数据(我们自己的数据与Sileane数据集)与真实数据(一个公开的Bin-Picking数据集),结果表明其在平均精度上显著优于最先进的方法15-31%。
引用
@article{arxiv.1806.03891,
title = {Multi-Task Deep Networks for Depth-Based 6D Object Pose and Joint Registration in Crowd Scenarios},
author = {Juil Sock and Kwang In Kim and Caner Sahin and Tae-Kyun Kim},
journal= {arXiv preprint arXiv:1806.03891},
year = {2018}
}