Softmax 多臂老虎机的消失 L2 正则化
机器学习
2026-05-06 v1 统计理论
机器学习
统计理论
摘要
多臂老虎机 (MAB) 算法是强化学习的基石,已在理论和数值上进行研究。最常用的实现方式采用 softmax 映射来规定最优政策,并为下游算法(包括 REINFORCE)奠定了基础。与普通方法不同,本文考虑 L2 正则化的 softmax 策略梯度,其中从平均奖励中减去二次项。以往利用凸性的研究未能识别分析其收敛的合适理论框架,当正则化参数消失时。我们在此证明了理论收敛结果,并经验上确认该 regime 下 L2 正则化在标准基准测试中具有数值优势。
关键词
引用
@article{arxiv.2605.03752,
title = {Vanishing L2 regularization for the softmax Multi Armed Bandit},
author = {Stefana-Lucia Anita and Gabriel Turinici},
journal= {arXiv preprint arXiv:2605.03752},
year = {2026}
}