BabyWalk:通过小步前进在视觉-语言导航中走得更远
人工智能
2020-06-16 v2 计算与语言
计算机视觉与模式识别
摘要
学习遵循指令对于视觉-语言导航(VLN)中的自主智能体具有根本重要性。在本文中,我们研究当智能体从由较短路径组成的语料库中学习时,如何能够导航长路径。我们表明现有的最先进智能体泛化能力不佳。为此,我们提出BabyWalk,一种新颖的VLN智能体,其通过学习将长指令分解为较短的指令(BabySteps)并顺序完成它们来进行导航。智能体使用一种特殊设计的记忆缓冲区将其过往经验转化为未来步骤的上下文。学习过程由两阶段组成。在第一阶段,智能体使用模仿学习从演示中完成BabySteps。在第二阶段,智能体使用基于课程的强化学习在指令逐渐变长的导航任务上最大化奖励。我们创建了两个新的基准数据集(长导航任务)并将其与现有数据集结合以检验BabyWalk的泛化能力。实证结果表明,BabyWalk在多个指标上达到了最先进结果,特别是能够更好地遵循长指令。代码与数据集已发布于我们的项目页面 https://github.com/Sha-Lab/babywalk。
引用
@article{arxiv.2005.04625,
title = {BabyWalk: Going Farther in Vision-and-Language Navigation by Taking Baby Steps},
author = {Wang Zhu and Hexiang Hu and Jiacheng Chen and Zhiwei Deng and Vihan Jain and Eugene Ie and Fei Sha},
journal= {arXiv preprint arXiv:2005.04625},
year = {2020}
}
备注
Accepted by ACL 2020