中文

基于Transformer的可扩展多主体强化学习:用于具有长程相互作用的网络系统

机器学习 2025-11-18 v1 多智能体系统 系统与控制 系统与控制

摘要

多主体强化学习(MARL)在大规模网络控制方面显示出前景,但现有方法面临两个主要局限性。首先,他们通常依赖导致局部主体相互作用衰减的假设,限制了捕捉长程依赖(如级联电力故障或流行病爆发)的能力。其次,大多数方法缺乏跨网络拓扑的通用性,需要应用于新图时重新训练。我们引入STACCA(带反事实优势的共享Transformer演员-评论家),一个统一的基于Transformer的MARL框架,解决上述两个挑战。STACCA采用集中式图Transformer评论家建模长程依赖并提供系统级反馈,同时其共享图Transformer演员学习一种可跨越多样网络结构适应的通用策略。进一步,为改进训练中的信用分配,STACCA集成了一种兼容状态价值评论家估计的新型反事实优势估计器。我们在流行病控制和谣言传播网络控制任务上评估STACCA,展示了 improved performance、网络泛化和可扩展性。这些结果凸显了基于Transformer的MARL架构在大规模网络系统中实现可扩展和可泛化控制的潜力。

关键词

引用

@article{arxiv.2511.13103,
  title  = {Transformer-Based Scalable Multi-Agent Reinforcement Learning for Networked Systems with Long-Range Interactions},
  author = {Vidur Sinha and Muhammed Ustaomeroglu and Guannan Qu},
  journal= {arXiv preprint arXiv:2511.13103},
  year   = {2025}
}

备注

8 pages, 7 figures, submitted for review