通过设计与乐观实现 Q-Learning 的稳定性
机器学习
2023-08-22 v2 系统与控制
系统与控制
最优化与控制
摘要
自 Chris Watkins 于 1980 年代在学位论文中引入以来,Q-learning 已成为强化学习工具箱的重要组成部分。本文部分旨在作为随机逼近与 Q-learning 的教程,提供关于 2023 年 6 月在法国南锡举行的 INFORMS APS 首届应用概率信托全体会议报告的细节。论文还提出了新方法,以保障这些算法及其他设定下随机逼近的稳定性与潜在的加速收敛。两项贡献完全新颖:1. 带线性函数逼近的 Q-learning 稳定性三十余年来一直是开放研究课题。研究表明,以修正 Gibbs 策略形式进行适当的乐观训练时,投影 Bellman 方程存在解,且算法稳定(即参数估计有界)。收敛性仍是诸多开放研究课题之一。2. 新 Zap Zero 算法旨在无需矩阵求逆地逼近牛顿-拉夫森流。在算法均值流向量场的温和假设及底层马尔可夫链的相容统计假设下,它稳定且收敛。该算法是随机逼近的通用方法,尤其适用于即便采用非线性函数逼近、以“遗忘式”训练的 Q-learning。
引用
@article{arxiv.2307.02632,
title = {Stability of Q-Learning Through Design and Optimism},
author = {Sean Meyn},
journal= {arXiv preprint arXiv:2307.02632},
year = {2023}
}
备注
Companion paper to the INFORMS APS inaugural Applied Probability Trust Plenary Lecture, presented in Nancy France, June 2023. Slides available online, Online, DOI 10.13140/RG.2.2.24897.33127