凸规划与李雅普诺夫函数在强化学习中的统一分析视角:基于值方法的研究
最优化与控制
2022-02-15 v1 机器学习
系统与控制
系统与控制
摘要
基于值的方法在马尔可夫决策过程(MDPs)和强化学习(RL)中起着基础性作用。本文提出了一个统一的控制理论框架,用于分析基于值的方法,如值计算(VC)、值迭代(VI)和时序差分(TD)学习(含线性函数逼近)。基于基于值的方法与动态系统之间的内在联系,我们可以直接利用控制理论中现有的凸检验条件,推导出上述基于值方法的各种收敛结果。这些检验条件以线性规划(LP)或半定规划(SDP)形式的凸规划出现,并可直截了当地求解以构造李雅普诺夫函数。我们的分析揭示了反馈控制系统与RL算法之间一些引人入胜的联系。希望这些联系能启发更多在系统/控制理论与RL交叉领域的工作。
引用
@article{arxiv.2202.06922,
title = {Convex Programs and Lyapunov Functions for Reinforcement Learning: A Unified Perspective on the Analysis of Value-Based Methods},
author = {Xingang Guo and Bin Hu},
journal= {arXiv preprint arXiv:2202.06922},
year = {2022}
}
备注
Accepted to ACC 2022