软最大策略梯度的Lyapunov分析:针对随机多臂老虎机
机器学习
2026-03-30 v1
摘要
我们将Lattimore (2026) 关于连续时间k臂随机多臂老虎机策略梯度的分析方法,适用于标准的离散时间设置。与连续时间情形相同,我们证明当学习率为 时,累积懊惧为 ,其中 为时域, 和 分别为最小和最大间隙。
关键词
引用
@article{arxiv.2603.26547,
title = {A Lyapunov Analysis of Softmax Policy Gradient for Stochastic Bandits},
author = {Tor Lattimore},
journal= {arXiv preprint arXiv:2603.26547},
year = {2026}
}
备注
6 pages