一种基于近最优变化检测的分段平稳组合半_bandit 算法
机器学习
2020-02-24 v4 机器学习
摘要
我们研究分段平稳组合半_bandit 问题。相较于原始组合半_bandit 问题,我们的设定假设基础臂的奖励分布可能在未知时间步以分段平稳方式改变。我们提出一种算法 \texttt{GLR-CUCB},它将高效的组合半_bandit 算法 \texttt{CUCB} 与几乎无参数的变化点检测器——广义似然比检验(GLRT)相结合。我们的分析表明 \texttt{GLR-CUCB} 的悔值上界为 ,其中 为分段平稳段数, 为基础臂数, 为时间步数。作为补充,我们利用信息论技术与精心构造的分段平稳 bandit 实例,推导了分段平稳多臂 bandit 与组合半_bandit 在 ) 阶上近乎匹配的悔值下界。我们的下界优于现有最佳悔值下界 。在合成与真实世界数据集上的数值实验证明了 \texttt{GLR-CUCB} 相较于其他 SOTA 算法的优越性。
引用
@article{arxiv.1908.10402,
title = {A Near-Optimal Change-Detection Based Algorithm for Piecewise-Stationary Combinatorial Semi-Bandits},
author = {Huozhi Zhou and Lingda Wang and Lav R. Varshney and Ee-Peng Lim},
journal= {arXiv preprint arXiv:1908.10402},
year = {2020}
}
备注
Accepted by AAAI 2020