中文

GoToNet:快速单目场景暴露与探索

计算机视觉与模式识别 2022-06-14 v1 机器学习

摘要

自主场景暴露与探索,尤其在定位或通信被拒止的区域中,对于在未知场景中发现目标十分有用,但仍是计算机导航中的一个难题。在本工作中,我们提出了一种用于实时环境探索的新方法,其仅有的需求是:一个用于预训练的视觉相似数据集、场景中足够的光照,以及一个用于环境感知的机载前视 RGB 相机。与现有方法不同,我们的方法只需一次观察(图像)即可做出良好的战术决策,因此以不增长、恒定的时间运行。两个方向预测,由被称为 Goto 像素和 Lookat 像素的像素表征,构成了我们方法的核心。这些像素以下述方式编码推荐的飞行指令:Goto 像素定义智能体应移动一个距离单位的方向,Lookat 像素定义下一步相机应指向的方向。这些飞行指令像素被优化以暴露当前最大量的未探索区域。我们的方法提出了一种新颖的基于深度学习的导航方法,能够解决该问题,并展示其在更复杂设置(即计算能力受限时)中的能力。此外,我们提出了一种生成面向导航的数据集的方法,使得能够利用 RGB 和深度图像高效训练我们的方法。在仿真器中进行的测试评估了稀疏像素坐标推断过程,以及旨在揭示区域并缩短与目标距离的 2D 和 3D 试飞,取得了有前景的结果。与最先进算法的比较表明,我们的方法能够超越它,比较指标包括每个相机位姿的新体素数、到目标的最小距离、已见表面体素百分比和计算时间度量。

关键词

引用

@article{arxiv.2206.05967,
  title  = {GoToNet: Fast Monocular Scene Exposure and Exploration},
  author = {Tom Avrech and Evgenii Zheltonozhskii and Chaim Baskin and Ehud Rivlin},
  journal= {arXiv preprint arXiv:2206.05967},
  year   = {2022}
}