MARL-CC:面向联通自主车辆的数学框架——解决非线性、部分可观测性与信用分配以实现最优控制
综合数学
2025-11-25 v1
摘要
多智能体强化学习 (MARL) 已成为联通自主车辆 (CAV) 协作决策的强大范式;然而,现有方法往往无法在由非线性动力学、部分可观测性和复杂智能体耦合所构成的系统中保证稳定性、最优性和可解释性。本研究通过引入 MARL-CC(Multi-Agent Reinforcement Learning with Control Coordination,联通自主车辆的数学框架),来解决这些基础性挑战。该框架整合了微分几何控制、贝叶斯推断和Shapley 价值信用分配于一个统一的优化架构中,确保政策更新受限、去中心化信念估计以及公平的奖励分配。理论分析在随机扰动和通信延迟下建立收敛和稳定性保证。实验评估通过仿真和实际测试平台表明,MARL-CC 在收敛速度和协作效率上相较于 PPO、DDPG 和 QMIX 等领先基线实现最高可达40%的提升。这些结果标志着控制导向强化学习的重大进展,弥合了数学严谨性与实际自主性之间的鸿沟。MARL-CC 框架为智能交通、无人机协调和分布式机器人提供了可扩展基础,为通向可解释、安全和自适应多智能体系统的道路铺路。所有代码和实验配置均已公开于 GitHub 以支持可重复性研究和后续研究。
关键词
引用
@article{arxiv.2511.17653,
title = {MARL-CC: A Mathematical Framework forMulti-Agent Reinforcement Learning in ConnectedAutonomous Vehicles: Addressing Nonlinearity,Partial Observability, and Credit Assignment forOptimal Control},
author = {Mazyar Taghavi and Javad Vahidi},
journal= {arXiv preprint arXiv:2511.17653},
year = {2025}
}