末段具身视觉导航
计算机视觉与模式识别
2022-11-22 v1 人工智能
机器学习
机器人学
摘要
诸如图像目标导航之类的真实长程任务包含探索与利用两个阶段。给定一个目标图像,具身智能体必须探索以发现目标,即利用学习到的先验高效搜索。一旦目标被发现,智能体必须精确校准至目标的末段导航。与任何鲁棒系统一样,在探索性目标发现与利用性末段导航之间切换可实现更好的错误恢复。遵循这些直观指导原则,我们提出 SLING 以提升现有图像目标导航系统的性能。我们完全补充先前方法,聚焦于末段导航并利用该问题的底层几何结构与神经描述子。通过简单而有效的切换,我们可以轻松将 SLING 与启发式、强化学习和神经模块化策略连接。在标准化图像目标导航基准(Hahn et al. 2021)上,我们在不同策略、场景和情节复杂度上提升了性能,将最先进水平从 45% 成功率提升至 55%。除照片级真实仿真外,我们在三个物理场景中进行了真实机器人实验,发现这些改进能很好地迁移至真实环境。
引用
@article{arxiv.2211.11746,
title = {Last-Mile Embodied Visual Navigation},
author = {Justin Wasserman and Karmesh Yadav and Girish Chowdhary and Abhinav Gupta and Unnat Jain},
journal= {arXiv preprint arXiv:2211.11746},
year = {2022}
}
备注
Accepted at CoRL 2022. Code and results available at https://jbwasse2.github.io/portfolio/SLING