中文

LC-Tsallis-INF:广义双世界最优线性上下文赌博机

机器学习 2025-05-29 v3 机器学习

摘要

我们研究了具有独立同分布(i.i.d.)上下文的线性上下文赌博机问题。在这个问题中,我们旨在开发一种在随机和对抗两种机制下均具有遗憾上界的双世界最优算法。我们开发了一种基于带有 Tsallis 熵的跟随正则化领导者(FTRL)的算法,称为 α\alpha-Linear-Contextual (LC)-Tsallis-INF。我们证明,在次优性间隙有下界一致假设下的随机机制中,其遗憾最多为 O(log(T))O(\log(T)),在对抗机制中最多为 O(T)O(\sqrt{T})。此外,我们的遗憾分析扩展到了由参数 β(1,]\beta \in (1, \infty] 的边际条件表征的更一般机制,该条件对次优性间隙施加了较温和的假设。我们证明,所提算法在边际条件下实现了 O(log(T)1+β2+βT12+β)O\left(\log(T)^{\frac{1+\beta}{2+\beta}}T^{\frac{1}{2+\beta}}\right) 的遗憾。

关键词

引用

@article{arxiv.2403.03219,
  title  = {LC-Tsallis-INF: Generalized Best-of-Both-Worlds Linear Contextual Bandits},
  author = {Masahiro Kato and Shinji Ito},
  journal= {arXiv preprint arXiv:2403.03219},
  year   = {2025}
}