中文

具有平滑奖励反馈的相关马尔可夫环境中的多臂老虎机

机器学习 2019-03-05 v2

摘要

我们研究动态环境中的多臂老虎机问题,其中臂的奖励根据马尔可夫链以相关方式演化。与许多相关工作的不同在于,在我们的表述中,学习算法既无法获取马尔可夫链状态的先验信息或观测,仅在我们称为 epoch 的时间间隔后观测到平滑奖励反馈。我们证明现有方法如 UCB 与 ε\varepsilon-greedy 在此类环境中可能遭受线性后悔。利用马尔可夫链的混合时间界,我们开发了称为 EpochUCB 与 EpochGreedy 的算法,其受前述方法启发,但对该问题表述具有次线性后悔保证。我们提出的算法以 epoch 进行:其中某一臂被重复抽取若干次,该次数随该臂过去被抽取次数线性增长。我们在两类平滑奖励反馈下分析这些算法:一类为 epoch 内折扣奖励的折扣平均奖励,另一类为 epoch 内奖励的时间平均奖励。

关键词

引用

@article{arxiv.1803.04008,
  title  = {Multi-Armed Bandits for Correlated Markovian Environments with Smoothed Reward Feedback},
  author = {Tanner Fiez and Shreyas Sekar and Lillian J. Ratliff},
  journal= {arXiv preprint arXiv:1803.04008},
  year   = {2019}
}

备注

Significant revision of prior version including deeper discussion of related work, gap-independent regret bounds, and regret bounds for discounted rewards