最优批处理线性赌博机
机器学习
2024-06-07 v1 统计理论
机器学习
统计理论
摘要
我们针对批处理线性赌博机问题引入了E算法,该算法采用了探索-估计-消除-利用(Explore-Estimate-Eliminate-Exploit)框架。通过适当选择探索率,我们证明E仅需个批次即可实现有限时间极小化最优遗憾,并且当时仅需个批次即可实现渐近最优遗憾,其中是时间范围。我们进一步证明了线性上下文赌博机批次复杂度的下界,表明任何渐近最优算法在时预期至少需要个批次,这表明E同时实现了遗憾和批次复杂度的渐近最优性。据我们所知,E是首个在具有相应最优批次复杂度的同时,同时实现极小化和渐近最优遗憾的线性赌博机算法。此外,我们表明,通过另一种探索率选择,E可实现实例相关的遗憾界,最多需要个批次,并保持极小化最优性和渐近最优性。我们在随机生成的实例和具有挑战性的\textit{End of Optimism}实例上进行了彻底的实验评估,后者被证明对基于乐观的算法难以学习。实验结果表明,E在遗憾最小化、批次复杂度和计算效率方面始终优于基线算法。
引用
@article{arxiv.2406.04137,
title = {Optimal Batched Linear Bandits},
author = {Xuanfei Ren and Tianyuan Jin and Pan Xu},
journal= {arXiv preprint arXiv:2406.04137},
year = {2024}
}
备注
26 pages, 6 figures, 4 tables. To appear in the proceedings of the 41st International Conference on Machine Learning (ICML 2024)