非平稳下分散式 PPO 的信赖域界
机器学习
2023-02-16 v3
摘要
我们给出了在协作多智能体强化学习(MARL)中优化分散式策略的信赖域界,其即使在转移动态非平稳时也成立。这一新分析从理论上理解了近期两种 MARL actor-critic 方法的强劲性能,它们都依赖于独立比率,即分别为每个智能体的策略计算概率比率。我们表明,尽管独立比率引起了非平稳性,但由于对所有分散式策略强制施加信赖域约束,仍会出现单调改进保证。我们还表明,该信赖域约束可通过基于训练中智能体数量约束独立比率而以原则性方式有效强制实施,为近端比率裁剪提供了理论基础。最后,我们的实证结果支持如下假设:IPPO 和 MAPPO 的强劲性能正是如在集中训练中通过裁剪强制此类信赖域约束、并依据智能体数量调节超参数的直接结果,正如我们的理论分析所预测。
引用
@article{arxiv.2202.00082,
title = {Trust Region Bounds for Decentralized PPO Under Non-stationarity},
author = {Mingfei Sun and Sam Devlin and Jacob Beck and Katja Hofmann and Shimon Whiteson},
journal= {arXiv preprint arXiv:2202.00082},
year = {2023}
}
备注
AAMAS 2023