中文

联邦线性对决赌博机

机器学习 2025-06-04 v2

摘要

上下文线性对决赌博机因其在推荐系统和大语言模型等重要领域的广泛应用,近期引起了极大关注。经典的对决赌博机算法通常仅适用于单个智能体。然而,对决赌博机的许多应用涉及多个希望协作以提高性能但不愿共享数据的智能体。这促使我们从联邦学习中汲取灵感,联邦学习涉及多个智能体旨在通过梯度下降(GD)协作训练其神经网络,而无需共享原始数据。先前的工作已开发出联邦线性赌博机算法,这些算法依赖于赌博机参数(例如,线性函数参数)的闭式更新来实现协作。然而,在线性对决赌博机中,线性函数参数缺乏闭式表达式,其估计需要最小化一个损失函数。这使得先前的方法不适用。在这项工作中,我们通过在线梯度下降(OGD,用于最小化损失函数以估计线性函数参数)与联邦学习的创新性和原则性结合,克服了这一挑战,从而引入了我们的基于 OGD 的联邦线性对决赌博机(FLDB-OGD)算法。通过严格的理论分析,我们证明了 FLDB-OGD 的累积遗憾具有次线性上界,并展示了遗憾与通信复杂度之间的理论权衡。我们进行了实证实验以证明 FLDB-OGD 的有效性,并揭示了有价值的见解,例如更多智能体数量的益处、遗憾-通信权衡等。

关键词

引用

@article{arxiv.2502.01085,
  title  = {Federated Linear Dueling Bandits},
  author = {Xuhan Huang and Yan Hu and Zhiyan Li and Zhiyong Wang and Benyou Wang and Zhongxiang Dai},
  journal= {arXiv preprint arXiv:2502.01085},
  year   = {2025}
}