中文

Logistic 型阈值问题中Thompson 抽样的信息论分析

机器学习 2025-02-21 v2 机器学习

摘要

我们研究了Thompson抽样算法在Logistic型阈值问题中的性能。在这种设置下,智能体接收二元奖励,其概率由Logistic函数 exp(βa,θ)/(1+exp(βa,θ))\exp(\beta \langle a, \theta \rangle)/(1+\exp(\beta \langle a, \theta \rangle)) 决定,其中斜率参数为 β>0\beta>0,且动作 aAa\in \mathcal{A} 和参数 θO\theta \in \mathcal{O} 均位于 dd 维单位球内。采用Russo和Van Roy (2016) 引入的信息论框架,我们分析了信息比,即一种量化即时报酬损失与关于最优动作信息增益之间权衡的统计量。我们在先前结果的基础上改进,证明信息比被界定为 92dα2\tfrac{9}{2}d\alpha^{-2},其中 α\alpha 是动作空间 A\mathcal{A} 与参数空间 O\mathcal{O} 对齐程度的鲁棒度度量,与 β\beta 无关。利用这一结果,我们推导出Thompson抽样在执行 TT 个时间步后所产生的贝叶斯期望后悔的界为 O(d/αTlog(βT/d))O(d/\alpha\sqrt{T \log(\beta T/d)})。据我们了解,这是首个仅以 β\beta 的对数依赖且独立于动作数量的Logistic型阈值后悔界。特别是,当动作空间包含参数空间时,期望后悔的界为 O~(dT)\tilde{O}(d \sqrt{T})

关键词

引用

@article{arxiv.2412.02861,
  title  = {An Information-Theoretic Analysis of Thompson Sampling for Logistic Bandits},
  author = {Amaury Gouverneur and Borja Rodríguez-Gálvez and Tobias J. Oechtering and Mikael Skoglund},
  journal= {arXiv preprint arXiv:2412.02861},
  year   = {2025}
}

备注

21 pages, under review