当组合Thompson采样遇上近似遗憾
机器学习
2023-02-23 v1 机器学习
摘要
我们在近似遗憾设定下研究组合多臂_bandit问题(CMAB)中的组合Thompson采样策略(CTS)。尽管CTS已引起大量关注,但在考虑非精确预言机时,它存在一个其他常见CMAB策略所没有的缺陷:对于某些预言机,CTS具有较差的近似遗憾(随时间段线性缩放)[Wang and Chen, 2018]。因此有必要研究以区分CTS能够学习的预言机。Kong等人[2021]启动了该研究:他们给出了CTS针对贪心预言机的首个近似遗憾分析,获得了阶的上界,其中为某最小奖励间隙。本文中,我们的目标是将该研究推进到贪心预言机之外的简单情形。我们在关于近似预言机的特定条件下,给出了CTS的首个近似遗憾上界,该条件允许归约至精确预言机分析。我们因此称此条件为REDUCE2EXACT,并观察到其在许多具体例子中得到满足。此外,它可扩展至概率触发臂设定,从而涵盖更多问题,如在线影响力最大化。
引用
@article{arxiv.2302.11182,
title = {When Combinatorial Thompson Sampling meets Approximation Regret},
author = {Pierre Perrault},
journal= {arXiv preprint arXiv:2302.11182},
year = {2023}
}
备注
Neurips 2022