面向具身视觉导航的深度学习:综述
机器人学
2021-10-12 v4 计算机视觉与模式识别
摘要
“具身视觉导航”问题要求智能体主要依赖其第一人称观测在三维环境中进行导航。由于该问题在自动驾驶、吸尘器和救援机器人等方面的广泛应用,近年来引起了越来越多的关注。一个导航智能体应具备多种智能技能,如视觉感知、建图、规划、探索和推理等。构建这样一个能够观察、思考和行动的智能体是实现真正智能的关键。深度学习方法卓越的学习能力使智能体能够完成具身视觉导航任务。尽管如此,具身视觉导航仍处于起步阶段,因为需要大量高级技能,包括感知部分观测的视觉输入、探索未见过区域、记忆和建模已见场景、理解跨模态指令以及适应新环境等。最近,具身视觉导航引起了学界越来越多的关注,并已提出大量工作来学习这些技能。本文试图通过提供全面的文献综述来建立具身视觉导航领域当前工作的轮廓。我们总结了基准与评价指标,回顾了不同方法,分析了挑战,并重点介绍了最先进(state-of-the-art, SOTA)的方法。最后,我们讨论了具身视觉导航领域中尚未解决的挑战,并给出了未来研究的有前景方向。
引用
@article{arxiv.2108.04097,
title = {Deep Learning for Embodied Vision Navigation: A Survey},
author = {Fengda Zhu and Yi Zhu and Vincent CS Lee and Xiaodan Liang and Xiaojun Chang},
journal= {arXiv preprint arXiv:2108.04097},
year = {2021}
}
备注
20 pages