竞争策略优化
机器学习
2020-06-19 v1 计算机科学与博弈论
多智能体系统
机器学习
摘要
竞争马尔可夫决策过程中策略优化的一个核心挑战是设计具有理想收敛性和稳定性的高效优化方法。为解决这一问题,我们提出了竞争策略优化(CoPO),一种利用竞争博弈的博弈论性质来推导策略更新的新型策略梯度方法。受竞争梯度优化方法的启发,我们推导出博弈目标的双线性近似。相比之下,现有的策略梯度方法仅利用线性近似,因此无法捕捉玩家之间的交互作用。我们以两种方式实例化 CoPO:竞争策略梯度,以及信任域竞争策略优化。我们在理论上研究了这些方法,并在一组全面且具有挑战性的竞争博弈上实证考察了其行为。我们观察到,它们提供了稳定的优化,收敛至复杂策略,并在与基线策略梯度方法对弈时获得更高分数。
引用
@article{arxiv.2006.10611,
title = {Competitive Policy Optimization},
author = {Manish Prajapat and Kamyar Azizzadenesheli and Alexander Liniger and Yisong Yue and Anima Anandkumar},
journal= {arXiv preprint arXiv:2006.10611},
year = {2020}
}
备注
11 pages main paper, 6 pages references, and 31 pages appendix. 14 figures