中文

基于分层强化学习的 Atari 球类游戏博弈

人工智能 2019-09-30 v1

摘要

人类尤其擅长从少量样本中推理与推断。面对新任务时,人类会利用先前学习的知识与技能,并快速将其与新任务整合。除通过试错学习外,人类还通过指导与示范进行社会文化式学习。以此方式,人类在许多任务中比当前大多数人工智能算法学习得快得多。本文中,我们检验通过社会学习加速机器学习的想法。我们认为,在解决现实世界问题时,尤其是当任务由人类设计且/或为人类设计时,通常存在来自用户手册和/或人类专家的指导,给出如何更好完成任务的准则。我们认为这些指导在设计与人类方式学习的强化学习系统中具有巨大价值,并通过玩 Atari 游戏 Tennis 和 Pong 检验该想法。我们通过实验证明,指导提供了关于任务的关键信息,可用于将学习任务分解为子系统并为时间扩展规划构造选项,从而大幅加速学习过程。

关键词

引用

@article{arxiv.1909.12465,
  title  = {Playing Atari Ball Games with Hierarchical Reinforcement Learning},
  author = {Hua Huang and Adrian Barbu},
  journal= {arXiv preprint arXiv:1909.12465},
  year   = {2019}
}