中文

使用深度强化学习的室内场景目标驱动视觉导航

计算机视觉与模式识别 2016-09-19 v1

摘要

深度强化学习较少被解决的两个问题是:(1) 缺乏对新目标目标的泛化能力,以及 (2) 数据低效,即模型需要大量(通常代价高昂的)试错回合才能收敛,这使得将其应用于现实世界场景变得不切实际。在本文中,我们解决了这两个问题,并将我们的模型应用于目标驱动视觉导航任务。为解决第一个问题,我们提出了一个 actor-critic 模型,其策略是目标以及当前状态的函数,从而能够更好地泛化。为解决第二个问题,我们提出了 AI2-THOR 框架,该框架提供了具有高质量 3D 场景和物理引擎的环境。我们的框架使智能体能够采取行动并与物体交互。因此,我们可以高效地收集大量训练样本。我们表明,我们提出的方法 (1) 比最先进的深度强化学习方法收敛更快,(2) 能跨目标和跨场景泛化,(3) 尽管模型在仿真中训练,但只需少量微调即可泛化到真实机器人场景,(4) 是端到端可训练的,且不需要特征工程、帧间特征匹配或环境的 3D 重建。补充视频可通过以下链接访问:https://youtu.be/SmBxMDiOrvs。

关键词

引用

@article{arxiv.1609.05143,
  title  = {Target-driven Visual Navigation in Indoor Scenes using Deep Reinforcement Learning},
  author = {Yuke Zhu and Roozbeh Mottaghi and Eric Kolve and Joseph J. Lim and Abhinav Gupta and Li Fei-Fei and Ali Farhadi},
  journal= {arXiv preprint arXiv:1609.05143},
  year   = {2016}
}