中文

奖励函数依赖于完整分布的纯探索_bandit 问题

机器学习 2021-05-11 v1

摘要

本文研究一般分布函数上的纯探索 bandit 模型,即每臂的奖励函数依赖于整个分布,而非仅其均值。我们改造 racing 框架与 LUCB 框架以解决该问题,并针对不同类型的分布设计估计奖励函数值的算法。接着我们证明,在恰当参数下我们的估计方法具有正确性保证,并得到了它们的样本复杂度上界。最后,我们讨论了若干重要应用及其在所学框架下的对应解法。

关键词

引用

@article{arxiv.2105.03598,
  title  = {Pure Exploration Bandit Problem with General Reward Functions Depending on Full Distributions},
  author = {Siwei Wang and Wei Chen},
  journal= {arXiv preprint arXiv:2105.03598},
  year   = {2021}
}