依赖于分布且时间一致的分段独立同分布多臂老虎机界限
机器学习
2019-06-10 v2 机器学习
摘要
我们考虑随机多臂老虎机的设置,其中奖励分布为分段独立同分布(piecewise i.i.d.)且有界,并具有未知变点。我们关注所有臂上同时发生变化的情况,并与现有文献截然不同,我们的目标是以差距依赖(而非仅差距无关)的悔恨界,涉及变化幅度 与最优性差距()。与以往工作不同,我们假设更为现实的场景:可能存在不可检测的变点间隙,并在一组不同假设下证明,只要每个变点的累积延迟检测有界,就无需强制探索来主动检测变点。我们引入了两种采用扫描统计量的 UCB 策略变体,以主动检测变点,而无需预先知道变点以及任何变化前后的均值。我们的第一种方法 \UCBLCPD 不知道变点数量 或时间范围 ,并利用拉普拉斯积分法为该设置实现了首个时间一致集中界。第二种策略 \ImpCPD 利用 的知识,实现了 的阶最优悔恨界(其中 为问题复杂度),从而在特定具有挑战性的设置中填补了与下界之间的重要空白。我们的理论发现得到了合成与真实数据集上数值实验的支持。
引用
@article{arxiv.1905.13159,
title = {Distribution-dependent and Time-uniform Bounds for Piecewise i.i.d Bandits},
author = {Subhojyoti Mukherjee and Odalric-Ambrym Maillard},
journal= {arXiv preprint arXiv:1905.13159},
year = {2019}
}
备注
Proceedings of the Reinforcement Learning for Real Life (RL4RealLife) Workshop in the 36th International Conference on Machine Learning, Long Beach, California, USA, 2019