中文

凸 Q-学习,第一部分:确定性最优控制

最优化与控制 2020-08-11 v1 机器学习

摘要

众所周知,将 Watkins 算法推广到一般函数逼近设定是具有挑战性的:投影 Bellman 方程是否有解?若有,该解在生成良好策略的意义上是否有用?若前述问题得到肯定回答,算法是否一致?即使在 Q 函数逼近关于参数线性的特殊情况下,这些问题也尚未解答。鉴于动态规划的凸分析方法历史悠久,这一挑战看似矛盾。本文首先简要综述最优控制的线性规划方法,引出一种特定的过参数化,其适用于强化学习应用。主要结论概括如下:(i)基于 Bellman 方程的凸松弛,引入了新一类凸 Q-学习(convex Q-learning)算法。在包括 Q 函数线性函数逼近的一般条件下建立了收敛性。(ii)一种批量实现看似与著名的 DQN 算法(AlphaZero 背后的引擎之一)相似。研究表明事实上两者截然不同:凸 Q-学习求解逼近 Bellman 方程的凸规划,而 DQN 的理论并不强于带函数逼近的 Watkins 算法:(a)表明二者寻求同一不动点方程的解,(b)两算法的 ODE 逼近重合,且该 ODE 的稳定性鲜有定论。这些结果针对具有总代价准则的确定性非线性系统获得。文中提出了诸多扩展,包括核实现以及向 MDP 模型的推广。

关键词

引用

@article{arxiv.2008.03559,
  title  = {Convex Q-Learning, Part 1: Deterministic Optimal Control},
  author = {Prashant G. Mehta and Sean P. Meyn},
  journal= {arXiv preprint arXiv:2008.03559},
  year   = {2020}
}

备注

This pre-print is written in a tutorial style so it is accessible to new-comers. It will be a part of a handout for upcoming short courses on RL. A more compact version suitable for journal submission is in preparation