中文

超越 Softmax:梯度多臂老虎机的新视角

机器学习 2025-10-07 v1 理论经济学

摘要

我们在离散选择模型与在线学习及多臂老虎机理论之间建立了联系。我们的贡献包括:(i) 为广泛的算法族提供亚线性 regret 界限,包含 Exp3 作为特例;(ii) 从广义嵌套 logit 模型 [citep{wen:2001}] 派生出新的对抗性老虎机算法;(iii) 我们引入一种新型的广义梯度老虎机算法,这种算法超越了广泛使用的 softmax 形式。通过放宽 softmax 固有的限制性独立假设,我们的框架能够容纳跨动作的相关学习动力学,从而拓宽了梯度老虎机方法的适用范围。总体而言,所提出的算法结合了灵活的模型规格与通过闭形式采样概率实现的计算效率。数值实验在随机老虎机设置下表明,这些方法在实际中具有有效性。

关键词

引用

@article{arxiv.2510.03979,
  title  = {Beyond Softmax: A New Perspective on Gradient Bandits},
  author = {Emerson Melo and David Müller},
  journal= {arXiv preprint arXiv:2510.03979},
  year   = {2025}
}