分组多臂赌博机中的协作极小极大遗憾
机器学习
2025-06-13 v1 机器学习
摘要
我们研究了在分组设置下共享探索对多臂赌博机的影响,其中各组具有重叠的可行动作集[Baek and Farias '24]。在这种分组赌博机设置中,各组共享奖励观测值,目标是最小化协作遗憾,定义为各组中最大遗憾。这自然捕捉了旨在平衡各组或群体之间探索负担的应用——已知标准算法可能导致各组之间探索成本严重不平衡。我们通过引入Col-UCB算法来解决该问题,该算法动态协调各组之间的探索。我们证明Col-UCB在忽略对数因子的情况下同时达到了最优的极小极大遗憾和实例相关的协作遗憾。这些界限自适应于各组之间共享动作集的结构,提供了关于何时协作比各组独立学习最优动作带来显著优势的洞察。
引用
@article{arxiv.2506.10313,
title = {Collaborative Min-Max Regret in Grouped Multi-Armed Bandits},
author = {Moïse Blanchard and Vineet Goyal},
journal= {arXiv preprint arXiv:2506.10313},
year = {2025}
}