中文

基于变化检测的 Thompson 采样框架用于非平稳赌博机

机器学习 2020-09-09 v1 信号处理

摘要

我们考虑一种非平稳双臂赌博机框架,并提出一种基于变化检测的 Thompson 采样(TS)算法,称为带变化检测的 TS(TS-CD),以跟踪动态环境。非平稳性使用泊松到达过程建模,该过程在每次到达时改变奖励均值。所提策略将臂近期奖励的经验均值与其历史奖励均值的估计进行比较。当经验均值偏离均值估计超过某一阈值时,检测到变化。随后,我们刻画了赌博机框架在发生变化时必须保持平稳的时间窗长度的下界,以使 TS-CD 能成功检测到变化。因此,我们的结果突出了泊松到达过程参数的上界,在此之上 TS-CD 以高概率实现渐近后悔最优性。最后,我们通过在无线网络中针对无线电接入技术(RAT)选择的边缘控制测试 TS-CD 来验证其有效性。结果表明,TS-CD 不仅优于经典最大功率 RAT 选择策略,也优于其他为非平稳环境设计的主动自适应与被动自适应赌博机算法。

关键词

引用

@article{arxiv.2009.02791,
  title  = {A Change-Detection Based Thompson Sampling Framework for Non-Stationary Bandits},
  author = {Gourab Ghatak},
  journal= {arXiv preprint arXiv:2009.02791},
  year   = {2020}
}

备注

Accepted for publication in IEEE Transactions on Computers