中文

用于多臂老虎机的非参数高斯混合模型

机器学习 2022-08-26 v4 机器学习 统计计算

摘要

我们在此采用贝叶斯非参数混合模型,将多臂老虎机(尤其是 Thompson 采样)扩展到存在奖励模型不确定性的场景。在随机多臂老虎机中,所玩臂的奖励由未知分布生成。奖励不确定性,即缺乏对奖励生成分布的了解,引发了探索-利用权衡:老虎机智能体需要同时学习奖励分布的性质并依次决定下一步采取哪个动作。在这项工作中,我们通过采用贝叶斯非参数高斯混合模型进行灵活的奖励密度估计,将 Thompson 采样扩展到存在奖励模型不确定性的场景。所提出的贝叶斯非参数混合模型 Thompson 采样依次学习最能逼近真实但未知的每臂奖励分布的奖励模型,取得了成功的后悔性能。我们基于一种新颖的基于后验收敛的分析,推导了所提方法的渐近后悔界。此外,我们在多样且先前难以处理的老虎机环境中实证评估了其性能,例如奖励不属于指数族、受异常值影响、以及具有不同每臂奖励分布的情况。我们表明,所提出的贝叶斯非参数 Thompson 采样在平均累积后悔和后悔波动性方面均优于最先进的替代方法。所提方法在存在老虎机奖励模型不确定性时具有价值,因为它避免了严格的逐案模型设计选择,同时提供了重要的后悔节省。

关键词

引用

@article{arxiv.1808.02932,
  title  = {Nonparametric Gaussian Mixture Models for the Multi-Armed Bandit},
  author = {Iñigo Urteaga and Chris H. Wiggins},
  journal= {arXiv preprint arXiv:1808.02932},
  year   = {2022}
}

备注

The software used for this study is publicly available at https://github.com/iurteaga/bandits