中文

多智能体 Lipschitz 拉普尔兹带环

机器学习 2026-02-20 v1

摘要

我们研究了在连续、具 Lipschitz 结构的动作空间上进行的去中心化多玩家随机赫尔米特问题,其中硬碰撞会导致零回报。我们的目标是设计一种无需通信的策略,以最大化总体回报,且协调成本独立于时间序列 TT。我们提出了模块化协议,首先解决多智能体协调问题——通过一种新颖的极大值导向搜索识别并为玩家在不同高价值区域的座位——然后将问题解耦为 NN 个独立的单玩家 Lipschitz 带环。我们建立了近最优的累积懊怨上界为 O~(T(d+1)/(d+2))\tilde{O}(T^{(d+1)/(d+2)}),加上与 TT 无关的协调成本,匹配单玩家的收敛率。据我们了解,这是首个能提供此类保证的框架,并且可推广至更一般的距离阈值碰撞模型。

关键词

引用

@article{arxiv.2602.16965,
  title  = {Multi-Agent Lipschitz Bandits},
  author = {Sourav Chakraborty and Amit Kiran Rege and Claire Monteleoni and Lijun Chen},
  journal= {arXiv preprint arXiv:2602.16965},
  year   = {2026}
}