中文

复杂视觉难探索领域 Minecraft 中的多任务课程学习

机器学习 2021-06-29 v1 机器学习

摘要

强化学习中的一个重要挑战是训练能够解决多种任务的智能体。如果任务之间相互依赖(例如需要先学会走再学会跑),课程学习可以通过聚焦于下一个最佳学习任务来加速学习。我们在具有许多难探索挑战的复杂视觉领域 Minecraft 中探索课程学习。我们发现学习进展(定义为任务成功概率的变化)是自动构建有效课程的可靠可学习性度量。我们引入了一种基于学习进展的课程,并在一个复杂的强化学习问题(称为“Simon Says”)上进行了测试,其中智能体被指示获取所需的物品。许多所需技能相互依赖。实验表明:(1) 用于获取新物品的片段内探索奖励可提升性能;(2) 在训练过程中动态调整该奖励使其仅适用于智能体尚不能稳定获取的物品,可进一步提升性能;(3) 基于学习进展的课程优雅地跟随智能体的学习曲线;(4) 当基于学习进展的课程与动态探索奖励结合时,其学习效率远高于均匀基线,且性能大幅提升。这些结果表明,将片段内与跨训练探索奖励与学习进展相结合,为自动化课程生成提供了一种有前景的方法,可能大幅提升我们训练能力更强、更具通用智能的智能体的能力。

关键词

引用

@article{arxiv.2106.14876,
  title  = {Multi-task curriculum learning in a complex, visual, hard-exploration domain: Minecraft},
  author = {Ingmar Kanitscheider and Joost Huizinga and David Farhi and William Hebgen Guss and Brandon Houghton and Raul Sampedro and Peter Zhokhov and Bowen Baker and Adrien Ecoffet and Jie Tang and Oleg Klimov and Jeff Clune},
  journal= {arXiv preprint arXiv:2106.14876},
  year   = {2021}
}

备注

first submission