镜像学习:策略优化的统一框架
机器学习
2024-11-21 v9 人工智能
摘要
现代深度强化学习(RL)算法的动机来自广义策略迭代(GPI)或信赖域学习(TRL)框架。然而,严格遵循这些理论框架的算法已被证明不可扩展。令人惊讶的是,唯一已知可扩展的算法违背了 GPI/TRL 假设,例如由于所需的正则化或其他启发式方法。对其经验成功的当前解释本质上是“类比式”的:它们被视为理论可靠方法的近似适配。不幸的是,研究表明这些算法在实践中与其概念祖先大相径庭。相反,本文我们引入一种新颖的理论框架,名为镜像学习(Mirror Learning),其为包括 TRPO 和 PPO 在内的一大类算法提供理论保证。尽管后两者利用了我们框架的灵活性,GPI 和 TRL 仅作为其中病态受限的特例而契合。这表明最先进方法的经验性能是其理论性质的直接结果,而非上述近似类比的结果。镜像学习使我们得以大胆探索新颖的、理论可靠的 RL 算法,一片迄今未被绘入地图的奇境。
引用
@article{arxiv.2201.02373,
title = {Mirror Learning: A Unifying Framework of Policy Optimisation},
author = {Jakub Grudzien Kuba and Christian Schroeder de Witt and Jakob Foerster},
journal= {arXiv preprint arXiv:2201.02373},
year = {2024}
}