用于视觉导航的封建网络
计算机视觉与模式识别
2024-12-16 v3 机器学习
机器人学
摘要
视觉导航遵循人类无需详细地图即可导航的直觉。一种常见的方法是在交互式探索过程中构建拓扑图,将图像置于节点上以用于规划。最近的变体从被动视频中学习,并能利用复杂的社会和语义线索进行导航。然而,这需要大量的训练视频,利用大型图,且由于使用了里程计,场景并非未见过的。我们引入了一种利用封建学习 (feudal learning) 进行视觉导航的新方法,该方法采用由 worker agent(工作者智能体)、中层管理者和高层管理者组成的层次结构。封建学习范式的关键在于,各层级的智能体看到任务的不同方面,并在不同的空间和时间尺度上运行。在此框架中开发了两个独特的模块。对于高层管理者,我们以自监督方式学习记忆代理图,以在学到的潜在空间中记录先前的观测,从而避免使用图和里程计。对于中层管理者,我们开发了一个路点网络,输出中间子目标,模仿人类在局部导航中的路点选择。该路点网络使用一组新的、小型的遥操作视频进行预训练,这些视频我们将公开提供,且训练环境与测试环境不同。生成的封建导航网络实现了接近 SOTA 的性能,同时为图像目标导航任务提供了一种新颖的无 RL、无图、无里程计、无度量地图的方法。
引用
@article{arxiv.2402.12498,
title = {Feudal Networks for Visual Navigation},
author = {Faith Johnson and Bryan Bo Cao and Ashwin Ashok and Shubham Jain and Kristin Dana},
journal= {arXiv preprint arXiv:2402.12498},
year = {2024}
}