通过 3D 特征场实现的视觉-语言导航的仿真到真实迁移
机器人学
2024-10-15 v3 计算机视觉与模式识别
摘要
视觉-语言导航 (VLN) 使智能体能够在 3D 环境中遵循自然语言指令导航至远程位置。在该领域中,智能体通常在导航模拟器中进行训练和评估,缺乏有效的仿真到真实迁移方法。仅使用单目相机的 VLN 智能体表现极为有限,而主流 VLN 模型使用全景观测进行训练,表现更好但难以部署在大多数单目机器人上。针对此问题,我们提出了一种仿真到真实迁移方法,为单目机器人赋予全景可遍历感知能力和全景语义理解,从而平滑地将高性能全景 VLN 模型迁移到常见的单目机器人。本文提出了语义可遍历地图,用于预测智能体中心的可导航 waypoint,并通过 3D 特征场预测这些可导航 waypoint 的新颖视图表示。这些方法拓宽了单目机器人受限视野的范围,显著提高了现实世界中的导航性能。我们的 VLN 系统在 R2R-CE 和 RxR-CE 基准测试中优于以往的 SOTA 单目 VLN 方法,并在真实环境中得到验证,为现实世界的 VLN 提供了实用且高性能的解决方案。
引用
@article{arxiv.2406.09798,
title = {Sim-to-Real Transfer via 3D Feature Fields for Vision-and-Language Navigation},
author = {Zihan Wang and Xiangyang Li and Jiahao Yang and Yeqi Liu and Shuqiang Jiang},
journal= {arXiv preprint arXiv:2406.09798},
year = {2024}
}
备注
Accepted by CoRL 2024. The code is available at https://github.com/MrZihan/Sim2Real-VLN-3DFF