Soft Q-Learning 的有限时间误差分析:切换系统方法
机器学习
2024-09-06 v3
摘要
Soft Q-learning 是 Q-learning 的一种变体,旨在求解熵正则化马尔可夫决策问题,其中智能体的目标是最大化熵正则化价值函数。尽管其在经验上取得了成功,但目前对 soft Q-learning 的理论研究仍然有限。本文旨在对 soft Q-learning 算法提供一种新颖且统一的有限时间控制论分析。我们关注两类 soft Q-learning 算法:一类使用 log-sum-exp 算子,另一类使用 Boltzmann 算子。通过使用动态切换系统模型,我们推导出了这两种 soft Q-learning 算法的新型有限时间误差界。我们希望我们的分析能够通过建立与切换系统模型的联系,加深目前对 soft Q-learning 的理解,甚至可能为其他强化学习算法的有限时间分析开辟新框架的道路。
引用
@article{arxiv.2403.06366,
title = {Finite-Time Error Analysis of Soft Q-Learning: Switching System Approach},
author = {Narim Jeong and Donghwan Lee},
journal= {arXiv preprint arXiv:2403.06366},
year = {2024}
}
备注
18 pages