随机线性多臂实验中的多代理最佳臂识别
机器学习
2025-05-27 v2
摘要
我们研究了在固定预算场景下针对随机线性多臂实验的协作式最佳臂识别问题。在我们的学习模型中,我们首先考虑通过星形网络相连的多个代理,平行地与线性多臂实例交互。我们随后扩展了分析到任意网络拓扑结构。代理的目标是通过中心服务器的帮助,在最小化最佳臂估计错误概率的同时,识别给定多臂实验的最佳臂。为此,我们提出了两种算法,分别针对星形网络和任意结构的网络,称为 MaLinBAI-Star 和 MaLinBAI-Gen。两种算法都利用 G-最优设计技术,结合基于成功消除策略的方法,其中代理在每个通信轮次中通过中心服务器共享他们的知识。我们在理论和实验方面都表明,所提出的算法在分配的时间预算内实现指数衰减的错误概率。此外,实验结果在合成数据和真实世界数据上都验证了我们算法相对于现有最先进的多代理算法的有效性。
引用
@article{arxiv.2411.13690,
title = {Multi-Agent Best Arm Identification in Stochastic Linear Bandits},
author = {Sanjana Agrawal and Saúl A. Blanco},
journal= {arXiv preprint arXiv:2411.13690},
year = {2025}
}
备注
Updated algorithms, corrected proofs, fixed typos