多臂赌博机问题中探索与利用的确定性序列
最优化与控制
2013-03-12 v3 机器学习
系统与控制
概率论
统计理论
统计理论
摘要
在多臂赌博机(MAB)问题中,存在一组具有未知奖励模型的臂。在每次时刻,玩家选择一个臂进行博弈,旨在最大化长度为 T 的时间跨度上的总期望奖励。本文开发了一种基于探索与利用的确定性序列(DSEE)的方法来构建序贯臂选择策略。结果表明,对于所有轻尾奖励分布,DSEE 实现了遗憾的最优对数阶,其中遗憾定义为与已知奖励模型的理想情况相比的总期望奖励损失。对于重尾奖励分布,当奖励分布的矩存在至第 p 阶(1<p<=2)时,DSEE 实现了 O(T^1/p) 的遗憾;当 p>2 时,实现了 O(T^1/(1+p/2)) 的遗憾。在已知重尾奖励分布有限矩上界的情况下,DSEE 提供了最优的对数阶遗憾。所提出的 DSEE 方法通过为一般奖励分布提供相应结果,补充了现有的 MAB 工作。此外,凭借明确定义的可调参数——探索序列的基数,DSEE 方法很容易扩展到 MAB 的各种变体,包括具有不同目标的 MAB、具有多个玩家且碰撞下奖励观测不完全的去中心化 MAB、具有未知马尔可夫动力学的 MAB,以及具有依赖臂的组合 MAB,这些变体常出现于诸如未知随机权重下的最短路径、最小生成树和支配集等网络优化问题中。
引用
@article{arxiv.1106.6104,
title = {Deterministic Sequencing of Exploration and Exploitation for Multi-Armed Bandit Problems},
author = {Sattar Vakili and Keqin Liu and Qing Zhao},
journal= {arXiv preprint arXiv:1106.6104},
year = {2013}
}
备注
22 pages, 2 figures