中文

多智能体阶段保守线性多臂乐问题

机器学习 2026-02-16 v3 系统与控制 系统与控制

摘要

在诸如推荐系统等众多实际应用中,多个学习智能体必须在保持安全保证以避免灾难性失败的同时平衡探索与开发。在多智能体网络设置中研究随机线性多臂乐问题,智能体必须满足阶段保守约束。NN 个智能体协同最大化累积奖励,同时确保每轮的预期奖励不低于基线策略的(1α)(1-\alpha)倍。每个智能体观察局部奖励(参数未知),但网络针对全局参数(局部参数的平均值)进行优化。智能体仅与直接邻居通信,每轮通信会产生额外报酬。我们提出MA-SCLUCB (Multi-Agent Stage-wise Conservative Linear UCB),一种周期算法在动作选择和共识构建阶段之间交替。我们证明MA-SCLUCB以高概率实现报酬 O~(dNTlog(NT)log(1/λ2))\tilde{O}\left(\frac{d}{\sqrt{N}}\sqrt{T}\cdot\frac{\log(NT)}{\sqrt{\log(1/|\lambda_2|)}}\right),其中dd为维数,TT为时域,λ2|\lambda_2|为网络第二个最大特征值的模。我们的分析表明:(i) 协作尽管仅进行局部通信可实现1N\frac{1}{\sqrt{N}}的改进,(ii) 通信开销仅随着良好连接网络的对数增长,(iii) 阶段安全仅引入次要报酬。因此,具备安全保证的分布式学习在合理连接的网络中实现近最优性能。

关键词

引用

@article{arxiv.2510.00602,
  title  = {Multi-Agent Stage-wise Conservative Linear Bandits},
  author = {Amirhossein Afsharrad and Ahmadreza Moradipari and Sanjay Lall},
  journal= {arXiv preprint arXiv:2510.00602},
  year   = {2026}
}