奖励函数依赖于完整分布的纯探索_bandit 问题
机器学习
2021-05-11 v1
摘要
本文研究一般分布函数上的纯探索 bandit 模型,即每臂的奖励函数依赖于整个分布,而非仅其均值。我们改造 racing 框架与 LUCB 框架以解决该问题,并针对不同类型的分布设计估计奖励函数值的算法。接着我们证明,在恰当参数下我们的估计方法具有正确性保证,并得到了它们的样本复杂度上界。最后,我们讨论了若干重要应用及其在所学框架下的对应解法。
引用
@article{arxiv.2105.03598,
title = {Pure Exploration Bandit Problem with General Reward Functions Depending on Full Distributions},
author = {Siwei Wang and Wei Chen},
journal= {arXiv preprint arXiv:2105.03598},
year = {2021}
}