中文

A2C 是 PPO 的一个特例

机器学习 2022-05-20 v1

摘要

优势 actor-critic(A2C)和近端策略优化(PPO)是近年来用于游戏 AI 的流行深度强化学习算法。一种普遍理解是,A2C 和 PPO 是独立的算法,因为 PPO 的裁剪目标函数与 A2C 的目标函数看起来显著不同。然而,在本文中,我们表明 A2C 是 PPO 的一个特例。我们给出理论依据和伪代码分析来论证其原因。为验证我们的主张,我们使用 \texttt{Stable-baselines3} 进行了一项实证实验,表明在其他设置受控时,A2C 和 PPO 产生\textit{完全相同}的模型。

关键词

引用

@article{arxiv.2205.09123,
  title  = {A2C is a special case of PPO},
  author = {Shengyi Huang and Anssi Kanervisto and Antonin Raffin and Weixun Wang and Santiago Ontañón and Rousslan Fernand Julien Dossa},
  journal= {arXiv preprint arXiv:2205.09123},
  year   = {2022}
}