连续环境中视觉与语言导航的仿真到仿真迁移
计算机视觉与模式识别
2022-04-26 v2 计算与语言
机器人学
摘要
近期视觉与语言导航(VLN)的工作提出了两种真实度不同的环境范式——基于拓扑环境构建的标准 VLN 设定,其中导航被抽象掉;以及 VLN-CE 设定,其中智能体必须使用底层动作在连续 3D 环境中导航。尽管共享高层任务甚至底层指令-路径数据,VLN-CE 上的性能仍显著落后于 VLN。在本工作中,我们通过将智能体从 VLN 的抽象环境迁移到 VLN-CE 的连续环境来探究这一差距。我们发现这种 sim-2-sim 迁移极为有效,将 VLN-CE 上先前最优水平提升了 +12% 成功率。虽然这展示了该方向的潜力,但该迁移并未完全保留智能体在抽象设定中的原始性能。我们给出了一系列实验以识别导致性能退化的差异,为进一步改进提供了明确方向。
引用
@article{arxiv.2204.09667,
title = {Sim-2-Sim Transfer for Vision-and-Language Navigation in Continuous Environments},
author = {Jacob Krantz and Stefan Lee},
journal= {arXiv preprint arXiv:2204.09667},
year = {2022}
}
备注
Changes: figure compression for accessibility