用于无遗憾学习的简单意见动力学
机器学习
2024-10-21 v5 分布式、并行与集群计算
数据结构与算法
摘要
我们在分布式 GOSSIP 模型中研究协作多智能体 bandit 设置:在每一轮中, 个智能体各自从公共集合中选择一个动作,观测该动作对应的奖励,随后与随机选定的单个邻居交换信息,这可能影响其在下一轮的选择。我们为这一设置引入并分析了一系列无记忆且时间无关的协议,其灵感来自 GOSSIP 模型中其他算法任务里已被充分研究的意见动力学。对于平稳奖励设置,我们首次证明这些简单协议展现出两全其美的行为,同时获得随 缩放的常数累积遗憾,并在 轮内就最高均值动作达成共识。我们通过揭示这些去中心化协议的全局演化与一类零和乘性权重更新过程之间的新联系而得到这些结果。利用该联系,我们建立了一个用于分析协议在群体层面的遗憾及其他性质的通用框架。最后,我们表明我们的协议对对抗性奖励也出奇地鲁棒,且在该情形下只要轮数作为 的函数增长不太快,我们就获得随 缩放的次线性遗憾。
引用
@article{arxiv.2306.08670,
title = {Simple Opinion Dynamics for No-Regret Learning},
author = {John Lazarsfeld and Dan Alistarh},
journal= {arXiv preprint arXiv:2306.08670},
year = {2024}
}