学习对抗任意对手混合策略
多智能体系统
2021-06-04 v2
摘要
直观上,在给定领域中对抗某一对手混合策略的经验,应可迁移至同一领域中不同的混合策略。我们提出一种迁移学习方法Q-Mixing,其首先针对每个纯策略对手学习Q值。然后,通过对分别学习到的Q值进行适当平均,来近似任意对手策略分布下的Q值。由这些组件,我们无需进一步训练即可构建对抗所有对手混合策略的策略。我们在两个环境中实证验证了Q-Mixing:一个简单的网格世界足球环境,以及一个复杂的网络安全博弈。我们发现Q-Mixing能够成功地将知识迁移至任意对手混合策略。接下来我们考虑在博弈过程中利用观测来更新所相信的对手分布。我们引入一个对手分类器——与Q学习并行训练,使用相同数据——并利用分类器结果来精炼Q值的混合。我们发现,辅以对手分类器功能的Q-Mixing表现与直接针对混合策略对手训练相当,且方差更低。
引用
@article{arxiv.2009.14180,
title = {Learning to Play against Any Mixture of Opponents},
author = {Max Olan Smith and Thomas Anthony and Yongzhao Wang and Michael P. Wellman},
journal= {arXiv preprint arXiv:2009.14180},
year = {2021}
}