中文

通过自适应臂排序规则在 restless 多臂老虎机中学习

机器学习 2019-06-20 v1 机器学习

摘要

我们考虑一类臂动态未知的不安分多臂老虎机(RMAB)问题。在每时刻,玩家从 N 个臂中选择一个臂进行拉动,称为活跃臂,并从有限奖励状态集合中收到随机奖励。活跃臂的奖励状态依据未知的马尔可夫动态转移。被动臂(在时刻 t 未被选择拉动的臂)的奖励状态依据任意未知的随机过程演化。目标是最小化遗憾值(regret)的选臂策略,遗憾值定义为相对于始终拉动奖励最高臂的玩家所产生的奖励损失。这类 RMAB 问题近期已在通信网络与金融投资应用中被研究。我们开发了一种连续方式选择拉动臂的策略,称为自适应排序规则(ASR)算法。ASR 算法下用于选臂的排序规则由当前样本奖励均值自适应更新与控制。通过精心设计自适应排序规则,我们证明 ASR 算法实现了关于时间的对数级遗憾阶,并建立了遗憾值的有限样本界。尽管现有方法已在该 RMAB 设定下展示出关于时间的对数级遗憾阶,理论分析表明在 ASR 下遗憾值随系统参数的标度有显著改善。大量仿真结果支撑了理论研究,并展现出相较现有方法的强劲性能。

关键词

引用

@article{arxiv.1906.08120,
  title  = {Learning in Restless Multi-Armed Bandits via Adaptive Arm Sequencing Rules},
  author = {Tomer Gafni and Kobi Cohen},
  journal= {arXiv preprint arXiv:1906.08120},
  year   = {2019}
}

备注

A short version of this paper was presented at IEEE International Symposium on Information Theory (ISIT) 2018