中文

最大最小公平多智能体_bandits的近最优隐私保护学习

机器学习 2026-05-05 v3 计算机与社会 分布式、并行与集群计算

摘要

我们研究仅碰撞协调下的公平多智能体多臂_bandit学习。智能体在学习期间无法显式通信,仅能观测自身奖励以及多个智能体访问同一臂时是否发生碰撞。目标是在保持各智能体奖励样本与经验奖励估计本地化的同时,学习最大最小公平分配。我们针对具有未知支撑的有界奖励提出一种完全分布式算法,其遗憾为O ⁣(N3f(logT)logT)O\!\left(N^3 f(\log T)\log T\right),其中ff为任意满足f(k1)/f(k)1f(k-1)/f(k)\to 1的非递减发散函数。该算法结合了分布式智能体排序、累积轮询探索、端点再验证热启动二分法,以及用于阈值可行性测试的基于碰撞的分布式拍卖。与基于领导者的优化算法不同,没有任何智能体收集其他智能体的奖励观测、经验估计或偏好。因此,该协议在避免奖励共享的操作意义上保留奖励隐私,仅通过碰撞结果进行协调。与先前具有随智能体数量指数依赖的隐私保护最大最小公平_bandit算法相比,我们的方法实现了多项式N3N^3依赖,同时保持对TT的近对数依赖。分析使用了累积经验估计的集中性与端点再验证二分法的稳定性。仿真在代表性数值设定下证实了所预测的随视野、智能体数量和最大最小间隙的缩放关系。

关键词

引用

@article{arxiv.2306.04498,
  title  = {Near-Optimal Privacy-Preserving Learning for Max-Min Fair Multi-Agent Bandits},
  author = {Amir Leshem},
  journal= {arXiv preprint arXiv:2306.04498},
  year   = {2026}
}

备注

17 pages, 3 figures