鲁棒的批量赌博问题
机器学习
2026-03-24 v2 机器学习
摘要
批量多臂赌博(MAB)问题,即以批量方式收集奖励的情形,对于临床试验等应用至关重要。现有研究主要假设奖励分布为轻尾分布,而许多实际场景(包括临床结果)表现出重尾特征。本文在有限臂数和Lipschitz连续性设置下,提出针对重尾奖励的鲁棒批量赌博算法。我们发现了一个令人惊讶的现象:在实例无关的 regimes以及Lipschitz设置下,奖励呈重尾分布需要更少的批量数才能实现近最优 regret。与此相反,在实例相关的设置下,实现近最优 regret所需的批量数与尾部厚度无关。
引用
@article{arxiv.2510.03798,
title = {Robust Batched Bandits},
author = {Yunwen Guo and Yunlun Shu and Gongyi Zhuo and Tianyu Wang},
journal= {arXiv preprint arXiv:2510.03798},
year = {2026}
}
备注
39 pages