探索策略改进与 q-learning 的遗憾分析
机器学习
2024-11-05 v1 最优化与控制
概率论
摘要
我们研究了 Jia 和 Zhou(J. Mach. Learn. Res., 24 (2023), 161)提出的 q-learning 及相关算法在受控扩散过程中的收敛性。在模型参数的增长与正则性满足适当条件下,我们对探索策略改进算法和 q-learning 算法均提供了定量误差与遗憾分析。
引用
@article{arxiv.2411.01302,
title = {Regret of exploratory policy improvement and $q$-learning},
author = {Wenpin Tang and Xun Yu Zhou},
journal= {arXiv preprint arXiv:2411.01302},
year = {2024}
}
备注
23 pages, 1 figure