离线 Bandit 中的贝叶斯后悔最小化
机器学习
2024-07-04 v3 机器学习
摘要
我们研究在离线线性 bandit 中如何做出最小化贝叶斯后悔的决策。先前工作表明必须采取奖励下置信界(LCB)最大的动作。我们论证在此设定下对 LCB 的依赖固有缺陷,并提出一种新算法,利用高效锥优化求解器直接最小化贝叶斯后悔的上界。我们的界大量建立在到货币风险度量的新联系之上。通过证明匹配下界,我们表明上界是紧的,且通过最小化它们我们保证优于 LCB 方法。我们在合成域上的数值结果确认该方法优于 LCB。
引用
@article{arxiv.2306.01237,
title = {Bayesian Regret Minimization in Offline Bandits},
author = {Marek Petrik and Guy Tennenholtz and Mohammad Ghavamzadeh},
journal= {arXiv preprint arXiv:2306.01237},
year = {2024}
}