弥合视觉语言导航中离散与连续环境学习之间的鸿沟
计算机视觉与模式识别
2022-03-08 v1 计算与语言
机器人学
摘要
大多数现有的视觉语言导航(VLN)工作聚焦于离散或连续环境之一,所训练的智能体无法在二者间泛化。这两种设置的根本区别在于,离散导航假设已知环境的连通图,从而智能体可通过锚定到可导航方向的图像,将低层控制导航问题有效转化为以高层动作在节点间跳跃。为弥合离散到连续的鸿沟,我们提出一种预测器,在导航过程中生成一组候选路点,使得以高层动作设计的智能体能够被迁移至连续环境中训练。我们将 Matterport3D 的连通图精炼以适配连续的 Habitat-Matterport3D,并用精炼后的图训练路点预测器以在每个时间步产生可达路点。此外,我们展示了预测路点在训练时可被增强以丰富视角与路径,从而提升智能体的泛化能力。通过大量实验,我们表明在连续环境中借助预测路点导航的智能体显著优于使用低层动作的智能体,其将离散到连续的绝对鸿沟在 Cross-Modal Matching Agent 上缩小了 11.76% 的 Success Weighted by Path Length(SPL),在 Recurrent VLN-BERT 上缩小了 18.24% SPL。我们的智能体以简单的模仿学习目标训练,大幅优于以往方法,在 R2R-CE 和 RxR-CE 数据集的测试环境中取得了新的最先进结果。
引用
@article{arxiv.2203.02764,
title = {Bridging the Gap Between Learning in Discrete and Continuous Environments for Vision-and-Language Navigation},
author = {Yicong Hong and Zun Wang and Qi Wu and Stephen Gould},
journal= {arXiv preprint arXiv:2203.02764},
year = {2022}
}