中文

变分贝叶斯乐观采样

机器学习 2021-11-01 v1 机器学习

摘要

我们考虑在线序贯决策问题,其中智能体必须平衡探索与利用。我们导出了一组贝叶斯“乐观”策略,在随机多臂老虎机情形下,该组策略包含 Thompson 采样策略。我们提供了新的分析,表明任何产生乐观集合中策略的算法,在具有 AA 个动作、经过 TT 轮的问题中,均享有 O~(AT)\tilde O(\sqrt{AT}) 的贝叶斯遗憾。我们将乐观策略的遗憾分析推广到双线性鞍点问题,其特例包括零和矩阵博弈与带约束老虎机。在此情形下,我们表明 Thompson 采样可能产生位于乐观集合之外的策略,并在某些实例中遭受线性遗憾。寻找乐观集合内的策略等价于求解一个凸优化问题,我们将所得算法称为“变分贝叶斯乐观采样”(VBOS)。该过程适用于任意后验,即不要求后验具有任何特殊性质,如对数凹性、单峰性或光滑性。该问题的变分视角具有许多有用性质,包括调节探索-利用权衡、添加正则化、纳入约束以及策略的线性参数化能力。

关键词

引用

@article{arxiv.2110.15688,
  title  = {Variational Bayesian Optimistic Sampling},
  author = {Brendan O'Donoghue and Tor Lattimore},
  journal= {arXiv preprint arXiv:2110.15688},
  year   = {2021}
}