中文

基于 Kolmogorov-Smirnov 检验的非平稳 Bandit 主动自适应 Thompson 采样

机器学习 2021-10-22 v2 机器学习 多智能体系统

摘要

我们考虑非平稳多臂 bandit(MAB)框架,并提出一种基于 Kolmogorov-Smirnov(KS)检验的 Thompson 采样(TS)算法,称为 TS-KS,该算法主动检测变化点,并在检测到变化后重置 TS 参数。特别地,对于双臂 bandit 情形,我们推导了在变化发生后检测该变化所需奖励分布样本数量的界。据此,我们证明所提算法具有次线性后悔。与现有工作相反,即使均值奖励保持不变,当底层奖励分布发生改变时,我们的算法也能检测到变化。最后,为检验所提算法的有效性,我们将其用于两个案例研究:i)无线边缘计算中的任务卸载场景,以及 ii)投资组合优化。我们的结果表明,所提 TS-KS 算法不仅优于静态 TS 算法,而且优于其他为非平稳环境设计的 bandit 算法。此外,TS-KS 的性能与最先进的预测算法(如 Facebook-PROPHET 和 ARIMA)相当。

关键词

引用

@article{arxiv.2105.14586,
  title  = {Kolmogorov-Smirnov Test-Based Actively-Adaptive Thompson Sampling for Non-Stationary Bandits},
  author = {Gourab Ghatak and Hardhik Mohanty and Aniq Ur Rahman},
  journal= {arXiv preprint arXiv:2105.14586},
  year   = {2021}
}

备注

9 pages, 6 figures, 2 tables, 2 algorithms. Accepted at IEEE Transactions on Artificial Intelligence