中文

Softmax 多臂老虎机的消失 L2 正则化

机器学习 2026-05-06 v1 统计理论 机器学习 统计理论

摘要

多臂老虎机 (MAB) 算法是强化学习的基石,已在理论和数值上进行研究。最常用的实现方式采用 softmax 映射来规定最优政策,并为下游算法(包括 REINFORCE)奠定了基础。与普通方法不同,本文考虑 L2 正则化的 softmax 策略梯度,其中从平均奖励中减去二次项。以往利用凸性的研究未能识别分析其收敛的合适理论框架,当正则化参数消失时。我们在此证明了理论收敛结果,并经验上确认该 regime 下 L2 正则化在标准基准测试中具有数值优势。

关键词

引用

@article{arxiv.2605.03752,
  title  = {Vanishing L2 regularization for the softmax Multi Armed Bandit},
  author = {Stefana-Lucia Anita and Gabriel Turinici},
  journal= {arXiv preprint arXiv:2605.03752},
  year   = {2026}
}