基于物理的场景级推理用于杂乱环境中的物体位姿估计
机器人学
2019-04-04 v2 计算机视觉与模式识别
摘要
本文关注置于杂乱环境中的多个刚体的基于视觉的位姿估计,尤其涉及遮挡与物体相互叠放的情况。近期随着深度学习的进展,物体识别取得了进步。然而,此类工具通常需要大量训练数据与显著的手动标注工作,限制了其在机器人中的应用,因为机器人解决方案必须扩展到大量物体与多样条件。此外,多物体摆放可能产生的场景组合特性难以在训练数据集中涵盖,故所学模型可能无法达到诸如机器人操作等任务所需的精度水平。本工作提出了一种从数据生成到场景级推理与自学习的自主位姿估计流程。具体而言,该框架首先生成标注数据集以训练用于杂乱环境中物体检测的卷积神经网络(CNN)。这些检测结果用于引导场景级优化过程,该过程考虑杂乱中不同物体间的相互作用,输出高精度的位姿估计。进而,置信估计用于标注来自多视角的在线真实图像,并在自学习流程中重新训练该过程。实验结果表明,该流程能快速识别杂乱场景中物理一致的物体位姿,且比基于单个物体实例推理所得更为精确;此外,鉴于自学习过程,位姿估计质量随时间提升。
引用
@article{arxiv.1806.10457,
title = {Physics-based Scene-level Reasoning for Object Pose Estimation in Clutter},
author = {Chaitanya Mitash and Abdeslam Boularias and Kostas Bekris},
journal= {arXiv preprint arXiv:1806.10457},
year = {2019}
}
备注
18 pages, 13 figures, International Journal of Robotics Research (IJRR) 2019. arXiv admin note: text overlap with arXiv:1710.08577