中文

探索策略改进与 q-learning 的遗憾分析

机器学习 2024-11-05 v1 最优化与控制 概率论

摘要

我们研究了 Jia 和 Zhou(J. Mach. Learn. Res., 24 (2023), 161)提出的 q-learning 及相关算法在受控扩散过程中的收敛性。在模型参数的增长与正则性满足适当条件下,我们对探索策略改进算法和 q-learning 算法均提供了定量误差与遗憾分析。

关键词

引用

@article{arxiv.2411.01302,
  title  = {Regret of exploratory policy improvement and $q$-learning},
  author = {Wenpin Tang and Xun Yu Zhou},
  journal= {arXiv preprint arXiv:2411.01302},
  year   = {2024}
}

备注

23 pages, 1 figure