非贝叶斯游荡多臂赌博机:近对数严格遗憾情形
最优化与控制
2011-12-25 v1 机器学习
网络与互联网体系结构
系统与控制
概率论
摘要
在经典的贝叶斯游荡多臂赌博机问题中,存在个臂,所有臂上的奖励随时间以已知参数的马尔可夫链演化。玩家每次试图激活个臂,以最大化多次博弈中获得的总期望奖励。RMAB是一个具有挑战性的问题,已知在一般情况下是PSPACE-hard的。本文考虑更为困难的非贝叶斯RMAB问题,其中马尔可夫链的参数被假定为先验未知。我们针对该问题发展了一种原创方法,该方法适用于对应的贝叶斯问题具有如下结构的情形:根据已知参数值,最优解是某个预设的有限策略集中的一个。在此类设定下,我们建议通过采用一种合适的元策略来学习非贝叶斯RMAB的最优策略,该元策略将有限集中的每个策略视为另一个非贝叶斯多臂赌博机问题中的一个臂,而对该问题而言单臂选择策略是最优的。我们通过为未知动态信道上的机会频谱接入开发一种新颖的感知策略来展示该方法。我们证明了我们的策略实现了近对数遗憾(与知晓模型的先知相比的期望奖励差异),这导致了与已知模型下最优策略所能实现的相同的平均奖励。这是文献中关于非贝叶斯RMAB的首个此类结果。在我们的证明中,我们还发展了Chernoff-Hoeffding界的一个新颖推广。
引用
@article{arxiv.1109.1533,
title = {The Non-Bayesian Restless Multi-Armed Bandit: A Case of Near-Logarithmic Strict Regret},
author = {Wenhan Dai and Yi Gai and Bhaskar Krishnamachari and Qing Zhao},
journal= {arXiv preprint arXiv:1109.1533},
year = {2011}
}
备注
arXiv admin note: significant text overlap with arXiv:1011.4752