一种基于变化检测的分段平稳多臂老虎机问题框架
机器学习
2017-11-22 v2 人工智能
机器学习
摘要
多臂老虎机问题在平稳假设下已被广泛研究。然而在现实中,该假设常常不成立,因为奖励本身的分布可能随时间变化。本文中,我们提出了一种针对分段平稳设定下多臂老虎机问题的基于变化检测(CD)的框架,并研究了一类基于变化检测的 UCB(上置信界)策略,即 CD-UCB,其主动检测变化点并重启 UCB 索引。随后我们开发了 CUSUM-UCB 和 PHT-UCB,它们属于 CD-UCB 类,并分别使用累积和(CUSUM)与 Page-Hinkley 检验(PHT)来检测变化。我们证明了 CUSUM-UCB 在温和假设下获得了已知最好的后悔上界。我们还在任意伯努利奖励和 Yahoo! 网页点击率数据集上展示了 CD-UCB 策略的后悔降低。
引用
@article{arxiv.1711.03539,
title = {A Change-Detection based Framework for Piecewise-stationary Multi-Armed Bandit Problem},
author = {Fang Liu and Joohyun Lee and Ness Shroff},
journal= {arXiv preprint arXiv:1711.03539},
year = {2017}
}
备注
accepted by AAAI 2018