在星际争霸 II 中通过自动课程学习从单条人类演示引导多个异构执行体
机器学习
2022-05-13 v1 多智能体系统
摘要
传统上,通过直接行为克隆从人类演示中学习,若算法能获取大量覆盖智能体运行时最可能遭遇场景的高质量数据,可得到高性能策略。然而在真实场景中,专家数据有限,且期望训练出的智能体所学行为策略具有足够的泛化性,以处理人类专家未演示过的情况。另一替代方案是通过深度强化学习在无监督下学习这些策略,但此类算法需要大量计算时间才能在具有高维状态与动作空间的复杂任务(如星际争霸 II 中的任务)上表现良好。自动课程学习是一种近期机制,由若干技术组成,旨在根据智能体当前能力调整待解任务的难度,从而加速深度强化学习。然而,为足够复杂的任务设计恰当课程颇具挑战,因此我们利用人类演示作为训练中引导智能体探索的手段。本工作中,我们旨在训练能够指挥多个异构执行体的深度强化学习智能体,其起始位置与任务总体难度由基于单条人类演示自动生成的课程控制。我们的结果表明,通过自动课程学习训练的智能体在星际争霸 II 中基于真实军事场景建模的模拟指挥控制任务上,优于最先进的深度强化学习基线,并匹配人类专家的表现。
引用
@article{arxiv.2205.05784,
title = {Learning to Guide Multiple Heterogeneous Actors from a Single Human Demonstration via Automatic Curriculum Learning in StarCraft II},
author = {Nicholas Waytowich and James Hare and Vinicius G. Goecks and Mark Mittrick and John Richardson and Anjon Basak and Derrik E. Asher},
journal= {arXiv preprint arXiv:2205.05784},
year = {2022}
}
备注
Submitted to the 2022 SPIE Defense + Commercial Sensing (DCS) Conference on "Artificial Intelligence and Machine Learning for Multi-Domain Operations Applications IV"