具有平滑奖励反馈的相关马尔可夫环境中的多臂老虎机
机器学习
2019-03-05 v2
摘要
我们研究动态环境中的多臂老虎机问题,其中臂的奖励根据马尔可夫链以相关方式演化。与许多相关工作的不同在于,在我们的表述中,学习算法既无法获取马尔可夫链状态的先验信息或观测,仅在我们称为 epoch 的时间间隔后观测到平滑奖励反馈。我们证明现有方法如 UCB 与 -greedy 在此类环境中可能遭受线性后悔。利用马尔可夫链的混合时间界,我们开发了称为 EpochUCB 与 EpochGreedy 的算法,其受前述方法启发,但对该问题表述具有次线性后悔保证。我们提出的算法以 epoch 进行:其中某一臂被重复抽取若干次,该次数随该臂过去被抽取次数线性增长。我们在两类平滑奖励反馈下分析这些算法:一类为 epoch 内折扣奖励的折扣平均奖励,另一类为 epoch 内奖励的时间平均奖励。
引用
@article{arxiv.1803.04008,
title = {Multi-Armed Bandits for Correlated Markovian Environments with Smoothed Reward Feedback},
author = {Tanner Fiez and Shreyas Sekar and Lillian J. Ratliff},
journal= {arXiv preprint arXiv:1803.04008},
year = {2019}
}
备注
Significant revision of prior version including deeper discussion of related work, gap-independent regret bounds, and regret bounds for discounted rewards