Stackelberg actor-critic:博弈论强化学习算法
机器学习
2021-09-28 v1
摘要
基于actor-critic的强化学习算法中actor与critic的层级交互天然适合博弈论解释。我们采用此视角,将actor与critic的交互建模为具有领导者-跟随者结构(称为Stackelberg博弈)的两人一般和博弈。给定此抽象,我们提出Stackelberg actor-critic算法的元框架,其中领导者玩家遵循其目标的全导数而非通常的单独梯度。从理论角度,我们为精炼更新开发了策略梯度定理,并给出了Stackelberg actor-critic算法收敛至局部Stackelberg均衡的局部收敛保证。从经验角度,我们通过简单示例表明,相较于由actor-critic公式引发的代价结构下的通常梯度动力学,我们所研究的动力学减轻了循环并加速了收敛。最后,在OpenAI gym环境中的大量实验表明,Stackelberg actor-critic算法始终至少与标准actor-critic算法对应版本表现相当,且常显著优于后者。
引用
@article{arxiv.2109.12286,
title = {Stackelberg Actor-Critic: Game-Theoretic Reinforcement Learning Algorithms},
author = {Liyuan Zheng and Tanner Fiez and Zane Alumbaugh and Benjamin Chasnov and Lillian J. Ratliff},
journal= {arXiv preprint arXiv:2109.12286},
year = {2021}
}