中文

软最大策略梯度的Lyapunov分析:针对随机多臂老虎机

机器学习 2026-03-30 v1

摘要

我们将Lattimore (2026) 关于连续时间k臂随机多臂老虎机策略梯度的分析方法,适用于标准的离散时间设置。与连续时间情形相同,我们证明当学习率为 η=O(Δmin2/(Δmaxlog(n)))\eta = O(\Delta_{\min}^2/(\Delta_{\max} \log(n))) 时,累积懊惧为 O(klog(k)log(n)/η)O(k \log(k) \log(n) / \eta),其中 nn 为时域,Δmin\Delta_{\min}Δmax\Delta_{\max} 分别为最小和最大间隙。

关键词

引用

@article{arxiv.2603.26547,
  title  = {A Lyapunov Analysis of Softmax Policy Gradient for Stochastic Bandits},
  author = {Tor Lattimore},
  journal= {arXiv preprint arXiv:2603.26547},
  year   = {2026}
}

备注

6 pages