三思而后行:桥接无模型与基于模型的强化学习以实现前瞻规划的视觉-语言导航
计算机视觉与模式识别
2018-07-27 v2 人工智能
计算与语言
机器人学
摘要
现有的关于机器人导航视觉与语言对齐的研究侧重于在合成环境中改进无模型深度强化学习(DRL)模型。然而,无模型 DRL 模型未考虑真实世界环境中的动态特性,且通常难以泛化到新场景。在本文中,我们采取了一种激进的方法来弥合合成研究与真实世界实践之间的差距——我们提出了一种新颖的、前瞻规划的混合强化学习模型,该模型结合了无模型和基于模型的强化学习,以解决真实世界的视觉-语言导航任务。我们的前瞻模块将前瞻策略模型与预测下一状态和奖励的环境模型紧密集成。实验结果表明,我们提出的方法显著优于基线方法,并在真实世界的 Room-to-Room 数据集上取得最佳表现。此外,在迁移至未见环境时,我们可扩展的方法具有更好的泛化能力。
引用
@article{arxiv.1803.07729,
title = {Look Before You Leap: Bridging Model-Free and Model-Based Reinforcement Learning for Planned-Ahead Vision-and-Language Navigation},
author = {Xin Wang and Wenhan Xiong and Hongmin Wang and William Yang Wang},
journal= {arXiv preprint arXiv:1803.07729},
year = {2018}
}
备注
21 pages, 7 figures, with supplementary material