最大最小公平多智能体_bandits的近最优隐私保护学习
机器学习
2026-05-05 v3 计算机与社会
分布式、并行与集群计算
摘要
我们研究仅碰撞协调下的公平多智能体多臂_bandit学习。智能体在学习期间无法显式通信,仅能观测自身奖励以及多个智能体访问同一臂时是否发生碰撞。目标是在保持各智能体奖励样本与经验奖励估计本地化的同时,学习最大最小公平分配。我们针对具有未知支撑的有界奖励提出一种完全分布式算法,其遗憾为,其中为任意满足的非递减发散函数。该算法结合了分布式智能体排序、累积轮询探索、端点再验证热启动二分法,以及用于阈值可行性测试的基于碰撞的分布式拍卖。与基于领导者的优化算法不同,没有任何智能体收集其他智能体的奖励观测、经验估计或偏好。因此,该协议在避免奖励共享的操作意义上保留奖励隐私,仅通过碰撞结果进行协调。与先前具有随智能体数量指数依赖的隐私保护最大最小公平_bandit算法相比,我们的方法实现了多项式依赖,同时保持对的近对数依赖。分析使用了累积经验估计的集中性与端点再验证二分法的稳定性。仿真在代表性数值设定下证实了所预测的随视野、智能体数量和最大最小间隙的缩放关系。
引用
@article{arxiv.2306.04498,
title = {Near-Optimal Privacy-Preserving Learning for Max-Min Fair Multi-Agent Bandits},
author = {Amir Leshem},
journal= {arXiv preprint arXiv:2306.04498},
year = {2026}
}
备注
17 pages, 3 figures