中文

通过后悔到置信集转换改进(多项)逻辑_bandit的后悔界

机器学习 2024-03-14 v3 机器学习

摘要

逻辑_bandit是建模用户选择的普遍框架,例如广告推荐系统中的点击与不点击。我们观察到先前工作忽视或忽略了 Sθ2S \geq \lVert \theta_\star \rVert_2 中的依赖关系,其中 θRd\theta_\star \in \mathbb{R}^d 为未知参数向量,当 SS 较大(如 SdS \geq d)时此问题尤为突出。本工作中,我们通过一种称为{\it 后悔到置信集转换(R2CS)}的新方法改进了对 SS 的依赖,该方法使我们仅基于具有后悔保证的在线学习算法的\textit{存在性}即可构造凸置信集。利用R2CS,我们在逻辑_bandit中获得了关于 SS 的后悔界的严格改进,同时保持计算可行性及对 ddTT 等其他因素的依赖。我们将新置信集应用于逻辑_bandit的后悔分析,并采用新的鞅集中步骤规避了额外的 SS 因子。随后我们将该分析推广至多项逻辑_bandit,并在后悔上获得类似改进,展示了R2CS的有效性。尽管我们将R2CS应用于(多项)逻辑模型,R2CS是一种用于开发置信集的通用方法,可用于多种模型,这本身具有独立意义。

关键词

引用

@article{arxiv.2310.18554,
  title  = {Improved Regret Bounds of (Multinomial) Logistic Bandits via Regret-to-Confidence-Set Conversion},
  author = {Junghyun Lee and Se-Young Yun and Kwang-Sung Jun},
  journal= {arXiv preprint arXiv:2310.18554},
  year   = {2024}
}

备注

39 pages, 1 figure, 1 table; Accepted to the 27th International Conference on Artificial Intelligence and Statistics (AISTATS 2024) (ver2: fixed some errors and significantly expanded discussions on various parts, such as related work. ver3: fixed some minor typos)