中文

通过奖励时间稀有事件的自动课程学习

人工智能 2018-06-11 v2

摘要

奖励塑造允许强化学习(RL)智能体通过接收额外的奖励信号来加速学习。然而,这些信号往往难以手动设计,尤其是对于复杂的 RL 任务。我们提出了一种简单且通用的方法,该方法仅凭预定义事件的稀有性来决定其奖励。在此,事件被体验的次数越多,其带来的奖励就越少,这鼓励智能体在学习过程中不断探索新类型的事件。这种奖励函数的自适应性产生了一种无需实验者指定的自动课程学习形式。我们证明,这种事件稀有性(RoE)方法使智能体能够在无法获取环境外在奖励的情况下,成功应对具有挑战性的 VizDoom 场景。此外,结果表明 RoE 学习到了一种更具通用性的策略,能够很好地适应环境中的关键变化。基于稀有性对事件进行奖励,可能有助于解决许多未解的 RL 环境,这些环境的特点是外在奖励稀疏,但存在大量已知的事件类型。

关键词

引用

@article{arxiv.1803.07131,
  title  = {Automated Curriculum Learning by Rewarding Temporally Rare Events},
  author = {Niels Justesen and Sebastian Risi},
  journal= {arXiv preprint arXiv:1803.07131},
  year   = {2018}
}

备注

8 pages