老狗学新招:面向Bandit问题的随机化UCB
机器学习
2020-03-24 v2 机器学习
摘要
我们提出 ,一种基于理论上导出的置信区间(类似于上置信界(UCB)算法)的bandit策略,但类似于Thompson采样(TS),它使用随机化来权衡探索与利用。在 -臂bandit设定下,我们证明存在无穷多种 变体,它们均在 轮后达到极小极大最优的 后悔值。此外,针对一种特定的多臂bandit设定,我们证明UCB和TS均可作为 的特例恢复。对于结构化bandit,其中每个臂关联一个 维特征向量且奖励依据线性或广义线性模型分布,我们证明即便在无穷多臂情形下 也达到极小极大最优的 后悔值。通过在多臂与结构化bandit设定中的实验,我们表明 匹配或优于TS及其他随机化探索策略。我们的理论与实证结果共同表明 做到了两全其美。
引用
@article{arxiv.1910.04928,
title = {Old Dog Learns New Tricks: Randomized UCB for Bandit Problems},
author = {Sharan Vaswani and Abbas Mehrabian and Audrey Durand and Branislav Kveton},
journal= {arXiv preprint arXiv:1910.04928},
year = {2020}
}
备注
AISTATS 2020