中文

DFVS:深度光流引导的与场景无关基于图像的视觉伺服

机器人学 2020-03-10 v1 计算机视觉与模式识别 机器学习

摘要

现有的基于深度学习的视觉伺服方法回归一对图像间的相对相机位姿。因此,它们需要海量训练数据,且有时需微调以适应新场景。此外,当前方法不考虑场景的底层几何,而依赖相机位姿的直接估计。因此,相机位姿预测的不准确(尤其对于远距离目标)会导致伺服性能下降。本文中,我们提出一种双重解决方案:(i)我们将光流作为视觉特征,其由深度神经网络预测;(ii)这些流特征随后通过交互矩阵与另一神经网络提供的深度估计进行系统整合。我们进一步在照片级真实感 3D 仿真中跨多样场景给出广泛基准,以研究视觉伺服方法的收敛性与泛化性。在我们的挑战性基准上,我们实现了超过 3m 和 40 度的收敛,同时保持低于 2cm 和 1 度的精确定位,而现有方法对多数超过 1.5m 和 20 度的场景无法收敛。此外,我们还在 aerial robot 的真实场景中评估了我们的方法。我们的方法泛化至新场景,在 6 自由度定位任务中即使面对大幅相机变换也能产生精确且鲁棒的伺服性能,无需任何重训练或微调。

关键词

引用

@article{arxiv.2003.03766,
  title  = {DFVS: Deep Flow Guided Scene Agnostic Image Based Visual Servoing},
  author = {Y V S Harish and Harit Pandya and Ayush Gaud and Shreya Terupally and Sai Shankar and K. Madhava Krishna},
  journal= {arXiv preprint arXiv:2003.03766},
  year   = {2020}
}

备注

Accepted in International Conference on Robotics and Automation (ICRA) 2020, IEEE