中文

基于强化学习并带信息论正则化的视觉导航

机器人学 2022-05-10 v7

摘要

为增强基于深度强化学习(RL)的目标驱动视觉导航的跨目标与跨场景泛化能力,我们在 RL 目标中引入了一个信息论正则项。该正则化最大化导航动作与智能体视觉观测变换之间的互信息,从而促进更具信息量的导航决策。借此,智能体通过学习变分生成模型来建模动作-观测动力学。基于该模型,智能体由其当前观测与导航目标生成(想象)下一观测。如此,智能体学习理解导航动作与其观测变化之间的因果性,从而能通过比较当前与想象下一观测来预测下一导航动作。在 AI2-THOR 框架上的跨目标与跨场景评估表明,我们的方法相较若干最先进模型取得了至少 10% 的平均成功率提升。我们进一步在两个真实世界设定中评估模型:基于离散 Active Vision Dataset (AVD) 的未知室内场景导航,以及使用 TurtleBot 的连续真实世界环境。我们展示了我们的导航模型能够在这些场景中成功完成导航任务。视频与模型见补充材料。

关键词

引用

@article{arxiv.1912.04078,
  title  = {Reinforcement Learning-based Visual Navigation with Information-Theoretic Regularization},
  author = {Qiaoyun Wu and Kai Xu and Jun Wang and Mingliang Xu and Xiaoxi Gong and Dinesh Manocha},
  journal= {arXiv preprint arXiv:1912.04078},
  year   = {2022}
}

备注

corresponding author: Kai Xu ([email protected]) and Jun Wang ([email protected]), accepted by IEEE Robotics and Automation Letters