中文

层级遗传强化学习中的机器教学:用于集群牧养的奖励函数课程设计

人工智能 2019-01-07 v1

摘要

强化学习中奖励函数的设计是一种需要经验的人类技能。遗憾的是,文献中没有任何方法论可指导人类设计奖励函数,或使人类能以系统方式将设计奖励函数的技能传授给另一人类。本文中,我们利用人类教育中的系统性教学设计(Systematic Instructional Design)方法,设计出一种机器教育方法论,用于强化学习奖励函数的设计。我们在一层级遗传强化学习器的设计中演示该方法论,该学习器采用神经网络表示来演化一个智能体牧养基于 boids 的集群的控制器。结果表明,该方法论能够指导层级强化学习器的设计,其中层级中每个模型通过多部分奖励函数增量式地学习。该层级充当决策融合函数,将各指令习得的个体行为与技能相结合,以创建控制集群的智能牧养者。

关键词

引用

@article{arxiv.1901.00949,
  title  = {Machine Teaching in Hierarchical Genetic Reinforcement Learning: Curriculum Design of Reward Functions for Swarm Shepherding},
  author = {Nicholas R. Clayton and Hussein Abbass},
  journal= {arXiv preprint arXiv:1901.00949},
  year   = {2019}
}