中文

基于分数后验的汤普森采样广义后悔分析

机器学习 2023-09-13 v1 机器学习 系统与控制 系统与控制 最优化与控制 统计理论 统计理论

摘要

汤普森采样(TS)是解决随机多臂老虎机问题最流行且最早的算法之一。我们考虑 TS 的一个变体,称为 α\alpha-TS,其中我们使用分数或 α\alpha-后验(α(0,1)\alpha\in(0,1))代替标准后验分布。为计算 α\alpha-后验,标准后验定义中的似然被一个因子 α\alpha tempered。对于 α\alpha-TS,在关于先验和奖励分布的非常温和条件下,我们获得了实例依赖的 O(kiΔk(log(T)C(α)Δk2+12))\mathcal{O}\left(\sum_{k \neq i^*} \Delta_k\left(\frac{\log(T)}{C(\alpha)\Delta_k^2} + \frac{1}{2} \right)\right) 和实例无关的 O(KTlogK)\mathcal{O}(\sqrt{KT\log K}) 频率主义后悔界,其中 Δk\Delta_k 是第 kk 个臂与最优臂真实平均奖励之间的差距,C(α)C(\alpha) 是已知常数。次高斯和指数族模型均满足我们对奖励分布的通用条件。我们对先验分布的条件仅要求其密度为正、连续且有界。我们还建立了另一个实例依赖的后悔上界,其与改进 UCB [Auer and Ortner, 2010] 的相应界匹配(至多差常数倍)。我们的后悔分析精心结合了近期非渐近集中分析以及 α\alpha-后验分布的 Bernstein-von Mises 型结果的理论进展。此外,我们的分析不需要闭式后验或共轭先验等额外结构性质。

关键词

引用

@article{arxiv.2309.06349,
  title  = {Generalized Regret Analysis of Thompson Sampling using Fractional Posteriors},
  author = {Prateek Jaiswal and Debdeep Pati and Anirban Bhattacharya and Bani K. Mallick},
  journal= {arXiv preprint arXiv:2309.06349},
  year   = {2023}
}