中文

移动以获得更佳视野:自改进具身目标检测

计算机视觉与模式识别 2021-03-30 v2 人工智能 机器学习

摘要

被动式目标检测与分割方法将同一场景的图像视为独立样本,并未利用多视角下的物体恒存性。因此,对新颖或困难视角的泛化需要大量标注的额外训练。相比之下,人类常通过简单移动来获取更具信息量的视角来识别物体。在本文中,我们提出一种在测试环境中改进目标检测的方法,仅假设存在一个配备预训练 2D 目标检测器的具身智能体。我们的智能体收集多视角数据,生成 2D 与 3D 伪标签,并以自监督方式微调其检测器。在室内与室外数据集上的实验表明:(1) 我们的方法从多视角 RGB-D 数据中获取高质量 2D 与 3D 伪标签;(2) 使用这些伪标签微调可显著提升测试环境中的 2D 检测器;(3) 使用我们的伪标签训练 3D 检测器大幅优于先前的自监督方法;(4) 在弱监督下,我们的方法能为新颖物体生成更好的伪标签。

关键词

引用

@article{arxiv.2012.00057,
  title  = {Move to See Better: Self-Improving Embodied Object Detection},
  author = {Zhaoyuan Fang and Ayush Jain and Gabriel Sarch and Adam W. Harley and Katerina Fragkiadaki},
  journal= {arXiv preprint arXiv:2012.00057},
  year   = {2021}
}

备注

First three authors contributed equally. Project Page: https://ayushjain1144.github.io/SeeingByMoving/