星际争霸多智能体挑战+:无精确奖励函数下的多阶段任务与环境要素学习
机器学习
2022-07-08 v2 人工智能
摘要
本文提出一种称为星际争霸多智能体挑战+(StarCraft Multi-Agent Challenges+)的新基准,其中智能体学习执行多阶段任务并利用环境要素,而无须精确奖励函数。先前被公认为多智能体强化学习标准基准的挑战(SMAC)主要关注让所有智能体仅通过具有明显奖励函数的精细操控来协作消灭逼近的敌人。另一方面,本挑战感兴趣的是多智能体强化学习(MARL)算法的探索能力,以高效学习隐式多阶段任务、环境要素以及微观操控。本研究涵盖进攻与防御两类场景。在进攻场景中,智能体必须学习先发现对手再将其消灭。防御场景要求智能体利用地形特征。例如,智能体需将自己置于防护结构之后,以增加敌人攻击难度。我们在 SMAC+ 下考察 MARL 算法,观察到近期方法在与先前挑战相似的设定中表现良好,但在进攻场景中表现失常。此外,我们观察到一种增强的探索方法对性能有正向作用,但无法完全解决所有场景。本研究为未来研究提出了新方向。
引用
@article{arxiv.2207.02007,
title = {The StarCraft Multi-Agent Challenges+ : Learning of Multi-Stage Tasks and Environmental Factors without Precise Reward Functions},
author = {Mingyu Kim and Jihwan Oh and Yongsik Lee and Joonkee Kim and Seonghwan Kim and Song Chong and Se-Young Yun},
journal= {arXiv preprint arXiv:2207.02007},
year = {2022}
}
备注
ICML Workshop: AI for Agent Based Modeling 2022 Spotlight