BelMan:信念-奖励流形上的贝叶斯 bandit 方法
机器学习
2019-06-25 v2 人工智能
机器学习
摘要
我们提出一种通用的、贝叶斯的信息几何方法来处理多臂 bandit 问题中的探索-利用权衡。我们的方法 BelMan 统一支持纯探索、探索-利用以及两阶段 bandit 问题。关于 bandit 臂及其奖励分布的知识由臂的信念与奖励联合分布的重心(即信念-奖励流形内的伪信念-奖励)来概括。BelMan 交替进行 \emph{信息投影} 与 \emph{逆信息投影},即将伪信念-奖励投影到信念-奖励上以选择要拉动的臂,并将所得信念-奖励投影回伪信念-奖励。它引入了一种通过 \emph{焦点分布}(即逐渐集中于更高奖励的奖励分布)注入利用偏置的机制。与最先进算法的比较性能评估表明,BelMan 不仅具有竞争力,而且在特定设置(例如涉及多臂与连续奖励)下可以优于其他方法。
引用
@article{arxiv.1805.01627,
title = {BelMan: Bayesian Bandits on the Belief--Reward Manifold},
author = {Debabrota Basu and Pierre Senellart and Stéphane Bressan},
journal= {arXiv preprint arXiv:1805.01627},
year = {2019}
}
备注
36 pages, 14 figures, accepted in ECML PKDD 2019