中文

依赖于分布且时间一致的分段独立同分布多臂老虎机界限

机器学习 2019-06-10 v2 机器学习

摘要

我们考虑随机多臂老虎机的设置,其中奖励分布为分段独立同分布(piecewise i.i.d.)且有界,并具有未知变点。我们关注所有臂上同时发生变化的情况,并与现有文献截然不同,我们的目标是以差距依赖(而非仅差距无关)的悔恨界,涉及变化幅度 (Δi,gchg)(\Delta^{chg}_{i,g}) 与最优性差距(Δi,gopt\Delta^{opt}_{i,g})。与以往工作不同,我们假设更为现实的场景:可能存在不可检测的变点间隙,并在一组不同假设下证明,只要每个变点的累积延迟检测有界,就无需强制探索来主动检测变点。我们引入了两种采用扫描统计量的 UCB 策略变体,以主动检测变点,而无需预先知道变点以及任何变化前后的均值。我们的第一种方法 \UCBLCPD 不知道变点数量 GG 或时间范围 TT,并利用拉普拉斯积分法为该设置实现了首个时间一致集中界。第二种策略 \ImpCPD 利用 TT 的知识,实现了 min{O(i=1Kg=1Glog(T/H1,g)Δi,gopt),O(GT)}\min\big\lbrace O(\sum\limits_{i=1}^{K} \sum\limits_{g=1}^{G}\frac{\log(T/H_{1,g})}{\Delta^{opt}_{i,g}}), O(\sqrt{GT})\big\rbrace 的阶最优悔恨界(其中 H1,gH_{1,g} 为问题复杂度),从而在特定具有挑战性的设置中填补了与下界之间的重要空白。我们的理论发现得到了合成与真实数据集上数值实验的支持。

关键词

引用

@article{arxiv.1905.13159,
  title  = {Distribution-dependent and Time-uniform Bounds for Piecewise i.i.d Bandits},
  author = {Subhojyoti Mukherjee and Odalric-Ambrym Maillard},
  journal= {arXiv preprint arXiv:1905.13159},
  year   = {2019}
}

备注

Proceedings of the Reinforcement Learning for Real Life (RL4RealLife) Workshop in the 36th International Conference on Machine Learning, Long Beach, California, USA, 2019