多智能体学习系统用于交通控制的收敛性
机器学习
2026-05-19 v2 人工智能
多智能体系统
摘要
快速的城市化进程如班加罗鲁导致交通拥堵,使得高效交通信号控制(TSC)至关重要。多智能体强化学习(MARL),通常将每个交通信号建模为使用Q学习的独立智能体,已被证明是减少平均通勤延误的有前景的策略。尽管先前的工作Prashant L A等人已经验性地证明了这一方法的有效性,但对其在交通控制背景下的稳定性和收敛性进行严格的理论分析尚未探索。本文通过着眼于该多智能体算法的理论基础,弥合了这一鸿沟。我们聚焦于在合作TSC任务中使用独立学习者所固有的收敛问题。利用随机逼近方法,我们对学习动力学进行了正式分析。本工作的首要贡献是证明了该特定的多智能体强化学习算法在给定条件下收敛,将其从用于非同步价迭代的单智能体收敛证明扩展而来。
引用
@article{arxiv.2511.11654,
title = {Convergence of Multiagent Learning Systems for Traffic control},
author = {Sayambhu Sen and Shalabh Bhatnagar},
journal= {arXiv preprint arXiv:2511.11654},
year = {2026}
}
备注
14 pages 2 figures