批量学习在随机线性赌博机中的影响
机器学习
2023-04-04 v2
摘要
我们考虑赌博机问题的一个特例,称为批量赌博机(batched bandits),其中智能体在一段时间内观察到成批的反馈。与以往工作不同,我们考虑一种更具实际相关性的以批为中心的批量学习场景。也就是说,我们提供了一种策略无关(policy-agnostic)的悔恨(regret)分析,并给出了候选策略悔恨的上界和下界。我们的主要理论结果表明,批量学习的影响是相对于在线行为的悔恨而言的一个批大小乘性因子。我们主要研究随机线性赌博机的两种设置:有限臂和无限臂。虽然两种设置的悔恨界相同,但前者的结果在更弱的假设下成立。此外,作为重要见解,我们给出了针对 2-臂赌博机问题的更鲁棒结果。最后,我们通过实证实验证明了理论结果的一致性,并反思最优批大小的选择。
引用
@article{arxiv.2202.06657,
title = {The Impact of Batch Learning in Stochastic Linear Bandits},
author = {Danil Provodin and Pratik Gajane and Mykola Pechenizkiy and Maurits Kaptein},
journal= {arXiv preprint arXiv:2202.06657},
year = {2023}
}
备注
This is a longer version of the paper published at ICDM'22. arXiv admin note: text overlap with arXiv:2111.02071