中文

基于人类专家子目标选择的星际争霸 II 分层强化学习

人工智能 2020-09-30 v3

摘要

本工作受分层强化学习(HRL)(Barto and Mahadevan 2003; Hengst 2010)近期进展,以及基于启发式的子目标选择、经验回放(Lin 1993; Andrychowicz et al. 2017)和基于任务的课程学习(Bengio et al. 2009; Zaremba and Sutskever 2014)带来的学习效率提升的启发。我们提出一种新方法,通过基于人类专家的隐式课程设计,将 HRL、经验回放和有效子目标选择相整合,以支持样本高效学习并增强智能体行为的可解释性。在医学(Buch, Ahmed, and Maruthappu 2018)和法律(Cath 2018)等许多领域,由于伦理和法律原因,可解释性、可说明性和透明度在决策过程中至关重要,人类专业知识仍不可或缺。我们的方法通过将整体目标分解为不同抽象层次的子目标,简化了实现总体目标的复杂任务集。融入相关的主观知识也显著减少了 RL 在探索中耗费的计算资源,尤其是在高速、多变和复杂的环境中,其转移动力学无法在短期内被有效学习和建模。在两个星际争霸 II(SC2)(Vinyals et al. 2017)小游戏中的实验结果表明,我们的方法比扁平式和端到端 RL 方法取得更好的样本效率,并为解释智能体性能提供了有效方法。

关键词

引用

@article{arxiv.2008.03444,
  title  = {Hierarchical Reinforcement Learning in StarCraft II with Human Expertise in Subgoals Selection},
  author = {Xinyi Xu and Tiancheng Huang and Pengfei Wei and Akshay Narayan and Tze-Yun Leong},
  journal= {arXiv preprint arXiv:2008.03444},
  year   = {2020}
}

备注

In Submission to AAMAS 2021