具有群体外部性的分批多臂老虎机
机器学习
2021-10-01 v1 人工智能
摘要
在分批多臂老虎机(BMAB)中,策略不允许在每个时间步更新。通常,该设定规定允许的策略更新最大次数,算法对它们进行调度以最小化期望后悔。在本文中,我们描述了一种新颖的BMAB设定,其不同之处在于:策略更新的时机不受BMAB算法控制,而是每个批次期间接收到的数据量(称为群体(crowd))受过去臂选择的影响。我们首先设计了一个具有近似参数知识的近最优策略,我们证明其后悔为O(√(ln x / x)+ε),其中x为群体规模,ε为参数误差。接下来,我们实现了一种受UCB启发的算法,其保证额外的后悔为O(max(K ln T, √T ln T)),其中K为臂的数量,T为时间范围。
引用
@article{arxiv.2109.14733,
title = {Batched Bandits with Crowd Externalities},
author = {Romain Laroche and Othmane Safsafi and Raphael Feraud and Nicolas Broutin},
journal= {arXiv preprint arXiv:2109.14733},
year = {2021}
}
备注
31 pages