强化学习中的拉格朗日对偶性
机器学习
2020-07-28 v3 人工智能
最优化与控制
机器学习
摘要
尽管对偶性在某些领域(如机器学习中的监督学习)被广泛使用,但在其他领域(如强化学习(RL))中却鲜有探索。在本文中,我们展示了各式各样的 RL 工作如何涉及对偶性,从开创该领域的 Richard Bellman 的值迭代,到仅在过去几年内完成却已产生重大影响的 TRPO、A3C 和 GAIL。我们表明,对偶性在强化学习中并不罕见,尤其是在使用值迭代或动态规划时,或者在作一阶或二阶近似以将原本难解的问题转化为可解凸规划时。
引用
@article{arxiv.2007.09998,
title = {Lagrangian Duality in Reinforcement Learning},
author = {Pranay Pasula},
journal= {arXiv preprint arXiv:2007.09998},
year = {2020}
}
备注
8 pages, 0 figures; fixed typo in abstract