中文

Deep TAMER:高维状态空间中的交互式智能体塑造

人工智能 2018-01-23 v2 机器学习

摘要

尽管深度强化学习的最新进展使自主学习智能体能够在各种复杂任务中取得成功,但现有算法通常需要大量训练数据。提高智能体学习执行任务速度的一种方法是利用人类训练者的输入。尽管这种输入可以采取多种形式,但在人类难以或无法提供专家演示的情况下,实时的标量值反馈尤为有用。先前的方法已经证明了以这种方式提供的人类输入的有用性(例如 TAMER 框架),但迄今为止它们尚未考虑高维状态空间或采用深度学习。在本文中,我们同时做到了这两点:我们提出了 Deep TAMER,它是 TAMER 框架的扩展,利用深度神经网络的表征能力,以便在短时间内与人类训练者一起学习复杂任务。我们通过使用 Deep TAMER 以及仅 15 分钟的人类反馈来训练一个在 Atari 保龄球游戏中表现优于人类的智能体,从而展示了 Deep TAMER 的成功——这项任务即使对于最先进的强化学习方法也已被证明是困难的。

关键词

引用

@article{arxiv.1709.10163,
  title  = {Deep TAMER: Interactive Agent Shaping in High-Dimensional State Spaces},
  author = {Garrett Warnell and Nicholas Waytowich and Vernon Lawhern and Peter Stone},
  journal= {arXiv preprint arXiv:1709.10163},
  year   = {2018}
}

备注

9 pages, 6 figures