中文

多臂Bandit问题与批量UCB规则

统计理论 2019-02-04 v1 统计理论

摘要

我们对具有高斯收益分布的多臂bandit问题中某一策略的损失函数获得了上界。所考虑策略是J. Bather针对多臂bandit问题提出并利用UCB规则的策略的渐近推广,即选择对应于单步收益期望值当前估计的置信区间上界最大的动作。结果借助在单位视界上邻近分布域中控制的不变描述获得,因为恰在该处损失函数达到其最大值。UCB规则广泛用于机器学习。若有两种具有不同先验未知效率的备选处理方法可用,它也可用于批量数据处理的优化。

关键词

引用

@article{arxiv.1902.00214,
  title  = {Multi-Armed Bandit Problem and Batch UCB Rule},
  author = {Alexander Kolnogorov and Sergey Garbar},
  journal= {arXiv preprint arXiv:1902.00214},
  year   = {2019}
}