变分贝叶斯乐观采样
机器学习
2021-11-01 v1 机器学习
摘要
我们考虑在线序贯决策问题,其中智能体必须平衡探索与利用。我们导出了一组贝叶斯“乐观”策略,在随机多臂老虎机情形下,该组策略包含 Thompson 采样策略。我们提供了新的分析,表明任何产生乐观集合中策略的算法,在具有 个动作、经过 轮的问题中,均享有 的贝叶斯遗憾。我们将乐观策略的遗憾分析推广到双线性鞍点问题,其特例包括零和矩阵博弈与带约束老虎机。在此情形下,我们表明 Thompson 采样可能产生位于乐观集合之外的策略,并在某些实例中遭受线性遗憾。寻找乐观集合内的策略等价于求解一个凸优化问题,我们将所得算法称为“变分贝叶斯乐观采样”(VBOS)。该过程适用于任意后验,即不要求后验具有任何特殊性质,如对数凹性、单峰性或光滑性。该问题的变分视角具有许多有用性质,包括调节探索-利用权衡、添加正则化、纳入约束以及策略的线性参数化能力。
引用
@article{arxiv.2110.15688,
title = {Variational Bayesian Optimistic Sampling},
author = {Brendan O'Donoghue and Tor Lattimore},
journal= {arXiv preprint arXiv:2110.15688},
year = {2021}
}