超越指令导航:障碍物环境中的视觉语言导航
机器人学
2024-08-01 v1 计算与语言
计算机视觉与模式识别
摘要
现实导航通常需要应对意外障碍物,如关闭的门、移动的物体和不可预测的实体。然而,主流的视觉语言导航(VLN)任务通常假设指令与固定且预定义的导航图完全吻合,不存在任何障碍物。这一假设忽略了实际导航图与给定指令之间可能存在的差异,可能导致室内和室外智能体出现严重故障。为解决此问题,我们通过修改导航图和视觉观测,将多种障碍物整合到R2R数据集中,引入了一个创新数据集和任务——R2R with UNexpected Obstructions(R2R-UNO)。R2R-UNO包含各种类型和数量的路径障碍物,以生成VLN研究中的指令-现实不匹配。在R2R-UNO上的实验表明,现有的最先进VLN方法在面对此类不匹配时不可避免地遇到显著挑战,表明它们僵化地遵循指令而非自适应导航。因此,我们提出了一种名为ObVLN(Obstructed VLN)的新方法,包含课程训练策略和虚拟图构建,以帮助智能体有效适应障碍物环境。实验结果表明,ObVLN不仅在无障碍场景中保持了稳健性能,而且在面对意外障碍物时也取得了显著的性能优势。
引用
@article{arxiv.2407.21452,
title = {Navigating Beyond Instructions: Vision-and-Language Navigation in Obstructed Environments},
author = {Haodong Hong and Sen Wang and Zi Huang and Qi Wu and Jiajun Liu},
journal= {arXiv preprint arXiv:2407.21452},
year = {2024}
}
备注
Accepted to MM 2024