中文

在多项逻辑老虎机中利用非线性:一种极小化最优算法

机器学习 2026-02-25 v3 人工智能 机器学习 统计理论 统计理论

摘要

我们考虑多项逻辑老虎机问题,其中学习者通过选择动作以最大化基于多个可能结果的概率反馈的期望奖励。在二元设置中,近期的工作集中于理解逻辑模型非线性的影响 (Faury et al., 2020; Abeille et al., 2021)。他们引入了一个依赖于问题的常数 κ1\kappa_* \geq 1,该常数在某些问题参数下可能呈指数级增大,并由 sigmoid 函数的导数所刻画。它概括了非线性,并将现有的 TT 轮遗憾界从 O(dT)\smash{O(d\sqrt{T})} 改进为 O(dT/κ)\smash{O(d\sqrt{T/\kappa_*})},其中 dd 是参数空间的维度。我们将其分析扩展到具有有限动作空间的多项逻辑老虎机框架中,使其适用于具有两个以上选择的复杂应用,如强化学习或推荐系统。为此,我们将 κ\kappa_* 的定义扩展到多项设置,并提出了一种利用问题非线性的高效算法。我们的方法产生了阶为 O~(RdKT/κ)\smash{\widetilde{\mathcal{O}}( R d \sqrt{ {KT}/{\kappa_*}} ) } 的依赖于问题的遗憾界,其中 RR 表示奖励向量的范数,KK 是结果的数量。这改进了现有的阶为 O~(RdKT)\smash{\widetilde{\mathcal{O}}( RdK \sqrt{T} )} 的最佳保证。此外,我们提供了一个匹配的 Ω(dRKT/κ)\smash{ \Omega(dR\sqrt{KT/\kappa_*})} 下界,表明我们的算法是极小化最优的,且我们对 κ\kappa_* 的定义是最优的。

关键词

引用

@article{arxiv.2507.05306,
  title  = {Enjoying Non-linearity in Multinomial Logistic Bandits: A Minimax-Optimal Algorithm},
  author = {Pierre Boudart and Pierre Gaillard and Alessandro Rudi},
  journal= {arXiv preprint arXiv:2507.05306},
  year   = {2026}
}