中文

多臂赌博机问题中探索与利用的确定性序列

最优化与控制 2013-03-12 v3 机器学习 系统与控制 概率论 统计理论 统计理论

摘要

在多臂赌博机(MAB)问题中,存在一组具有未知奖励模型的臂。在每次时刻,玩家选择一个臂进行博弈,旨在最大化长度为 T 的时间跨度上的总期望奖励。本文开发了一种基于探索与利用的确定性序列(DSEE)的方法来构建序贯臂选择策略。结果表明,对于所有轻尾奖励分布,DSEE 实现了遗憾的最优对数阶,其中遗憾定义为与已知奖励模型的理想情况相比的总期望奖励损失。对于重尾奖励分布,当奖励分布的矩存在至第 p 阶(1<p<=2)时,DSEE 实现了 O(T^1/p) 的遗憾;当 p>2 时,实现了 O(T^1/(1+p/2)) 的遗憾。在已知重尾奖励分布有限矩上界的情况下,DSEE 提供了最优的对数阶遗憾。所提出的 DSEE 方法通过为一般奖励分布提供相应结果,补充了现有的 MAB 工作。此外,凭借明确定义的可调参数——探索序列的基数,DSEE 方法很容易扩展到 MAB 的各种变体,包括具有不同目标的 MAB、具有多个玩家且碰撞下奖励观测不完全的去中心化 MAB、具有未知马尔可夫动力学的 MAB,以及具有依赖臂的组合 MAB,这些变体常出现于诸如未知随机权重下的最短路径、最小生成树和支配集等网络优化问题中。

关键词

引用

@article{arxiv.1106.6104,
  title  = {Deterministic Sequencing of Exploration and Exploitation for Multi-Armed Bandit Problems},
  author = {Sattar Vakili and Keqin Liu and Qing Zhao},
  journal= {arXiv preprint arXiv:1106.6104},
  year   = {2013}
}

备注

22 pages, 2 figures