非贝叶斯动态多臂老虎机:近对数遗憾的一个案例
最优化与控制
2010-11-23 v1 机器学习
网络与互联网体系结构
概率论
摘要
在经典的贝叶斯动态多臂老虎机(RMAB)问题中,有N个臂,每个臂在每个时刻的奖励以已知参数的马尔可夫链演化。玩家试图在每个时刻激活K ≥ 1个臂,以最大化多次操作中获得的期望总奖励。RMAB是一个具有挑战性的问题,已知通常是PSPACE难的。本文考虑更困难的非贝叶斯RMAB,其中马尔可夫链的参数被假定为先验未知。我们针对该问题开发了一种原创方法,该方法适用于相应的贝叶斯问题具有以下结构的情况:根据已知的参数值,最优解是预设的有限策略集中的一个。在此类设置中,我们建议通过采用一种合适的元策略来学习非贝叶斯RMAB的最优策略,该元策略将有限集中的每个策略视为另一个不同非贝叶斯多臂老虎机问题中的一个臂,而该问题中单臂选择策略是最优的。我们通过为机会频谱接入开发一种新颖的感知策略来演示这种方法,该策略针对未知的动态信道。我们证明,我们的策略实现了近对数遗憾(与了解模型的精灵相比的期望奖励差异),从而获得了与已知模型下最优策略相同的平均奖励。这是文献中关于非贝叶斯RMAB的第一个此类结果。
引用
@article{arxiv.1011.4752,
title = {The Non-Bayesian Restless Multi-Armed Bandit: a Case of Near-Logarithmic Regret},
author = {Wenhan Dai and Yi Gai and Bhaskar Krishnamachari and Qing Zhao},
journal= {arXiv preprint arXiv:1011.4752},
year = {2010}
}