中文

Soft Q-Learning 的有限时间误差分析:切换系统方法

机器学习 2024-09-06 v3

摘要

Soft Q-learning 是 Q-learning 的一种变体,旨在求解熵正则化马尔可夫决策问题,其中智能体的目标是最大化熵正则化价值函数。尽管其在经验上取得了成功,但目前对 soft Q-learning 的理论研究仍然有限。本文旨在对 soft Q-learning 算法提供一种新颖且统一的有限时间控制论分析。我们关注两类 soft Q-learning 算法:一类使用 log-sum-exp 算子,另一类使用 Boltzmann 算子。通过使用动态切换系统模型,我们推导出了这两种 soft Q-learning 算法的新型有限时间误差界。我们希望我们的分析能够通过建立与切换系统模型的联系,加深目前对 soft Q-learning 的理解,甚至可能为其他强化学习算法的有限时间分析开辟新框架的道路。

关键词

引用

@article{arxiv.2403.06366,
  title  = {Finite-Time Error Analysis of Soft Q-Learning: Switching System Approach},
  author = {Narim Jeong and Donghwan Lee},
  journal= {arXiv preprint arXiv:2403.06366},
  year   = {2024}
}

备注

18 pages