中文

RGB-D 三项全能:面向机器人的敏捷视觉工具箱

机器人学 2019-04-03 v2 计算机视觉与模式识别

摘要

深度网络已为机器人感知带来显著进步,使机器人在从物体检测与识别到位姿估计、语义场景分割等诸多视觉任务中的能力得以提升。然而,大多数方法通常孤立地处理视觉任务,导致产生过度专门化的模型,其在特定应用中性能强劲,但在其他(通常相关的)任务中表现不佳。对于常常需要同时执行多种视觉识别任务以恰当行动并与环境交互的机器人而言,这显然是次优的。机器人平台上通常可用的有限计算与内存资源加剧了这一问题。近期,学习能以轻量方式处理多任务的灵活模型问题已在计算机视觉界受到关注,并提出了支持该研究的基准。本工作中,我们在机器人视觉背景下研究此问题,提出了一个新的基准——RGB-D 三项全能,并在这一新颖且具有挑战性的场景中评估了最先进算法。我们还定义了一种更契合机器人视觉设定的新评估协议。结果揭示了现有方法的优势与不足以及开放问题,为未来研究指明了方向。

关键词

引用

@article{arxiv.1904.00912,
  title  = {The RGB-D Triathlon: Towards Agile Visual Toolboxes for Robots},
  author = {Fabio Cermelli and Massimiliano Mancini and Elisa Ricci and Barbara Caputo},
  journal= {arXiv preprint arXiv:1904.00912},
  year   = {2019}
}

备注

This work has been submitted to IROS/RAL 2019