中文

自适应价值分解:城市系统中代理人数量可变的协调

多智能体系统 2026-02-17 v1 人工智能

摘要

多代理人强化学习(MARL)为协调多代理人系统(MAS)提供了有前景的范畴。然而,大多数现有方法依赖限制性假设,如固定代理人数量和完全同步的动作执行。这些假设在城市系统中常被违反,因为活跃代理人的数量随时间变化,动作可能具有异构持续时间,导致准MARL情形。此外,虽然在代理人之间共享策略参数是常见的做法,以提高学习效率,但当子集代理人在相似观察下同时做出决策时,这可能导致高度一致的动作,从而影响协调质量。为解决这些挑战,我们提出自适应价值分解(AVD),一个适应动态变化代理人数量的合作MARL框架。AVD进一步包含一种轻量级机制来缓解由共享策略导致的动作同质化,从而鼓励行为多样性并维持有效的代理间合作。此外,我们设计的训练-执行策略专为准MARL情形设计,可容纳某些代理人在不同时间做出异构决策。在两个实际城市的自行车共享 redistribution 任务(伦敦和华盛顿D.C.)上的实验表明,AVD优于最先进的基线,确认了其有效性和通用性。

关键词

引用

@article{arxiv.2602.13309,
  title  = {Adaptive Value Decomposition: Coordinating a Varying Number of Agents in Urban Systems},
  author = {Yexin Li and Jinjin Guo and Haoyu Zhang and Yuhan Zhao and Yiwen Sun and Zihao Jiao},
  journal= {arXiv preprint arXiv:2602.13309},
  year   = {2026}
}