中文

利用 HER 与幻觉 GAN 解决视觉任务中的样本复杂度问题

人工智能 2019-10-31 v2

摘要

强化学习(RL)算法通常需要在稀疏奖励设定下进行数百万次环境交互才能学习到成功的策略。后见之明经验回放(Hindsight Experience Replay, HER)作为一种通过更改最初设定的目标、将不成功的轨迹重新想象为成功轨迹从而提高样本效率的技术被提出。然而,它不能直接应用于视觉环境,其中目标状态通常由特定视觉特征的存在来刻画。在这项工作中,我们展示了如何通过使用在相对较少的目标快照上训练的生成模型来改变智能体观测,从而将视觉轨迹幻觉为看似成功。随后我们将该模型与 HER 结合,用于在视觉设定下训练 RL 智能体。我们在 3D 导航任务和模拟机器人应用上验证了我们的方法,并显示出相对于先前工作衍生基线的显著改进。

关键词

引用

@article{arxiv.1901.11529,
  title  = {Addressing Sample Complexity in Visual Tasks Using HER and Hallucinatory GANs},
  author = {Himanshu Sahni and Toby Buckley and Pieter Abbeel and Ilya Kuzovkin},
  journal= {arXiv preprint arXiv:1901.11529},
  year   = {2019}
}

备注

To appear in Neural Information Processing Systems (NeurIPS 2019), Vancouver, Canada. Code available at https://github.com/offworld-projects/research-halgan