中文

强化学习中的拉格朗日对偶性

机器学习 2020-07-28 v3 人工智能 最优化与控制 机器学习

摘要

尽管对偶性在某些领域(如机器学习中的监督学习)被广泛使用,但在其他领域(如强化学习(RL))中却鲜有探索。在本文中,我们展示了各式各样的 RL 工作如何涉及对偶性,从开创该领域的 Richard Bellman 的值迭代,到仅在过去几年内完成却已产生重大影响的 TRPO、A3C 和 GAIL。我们表明,对偶性在强化学习中并不罕见,尤其是在使用值迭代或动态规划时,或者在作一阶或二阶近似以将原本难解的问题转化为可解凸规划时。

关键词

引用

@article{arxiv.2007.09998,
  title  = {Lagrangian Duality in Reinforcement Learning},
  author = {Pranay Pasula},
  journal= {arXiv preprint arXiv:2007.09998},
  year   = {2020}
}

备注

8 pages, 0 figures; fixed typo in abstract