鲁棒均值场社交控制:统一的强化学习框架
系统与控制
2025-09-16 v2 系统与控制
摘要
本文研究线性二次高斯鲁棒均值场社交控制问题,面临乘法噪声。旨在计算无需完全了解代理动力学的渐近分散策略。主要挑战在于求解用于反馈增益的不可定型随机代数罗尔方程,以及用于前馈增益的不可定型代数罗尔方程。为克服这些挑战,我们首先提出统一的双环迭代框架,可处理这两种不可定型罗尔型方程,并为外环和内环迭代提供严格的收敛性证明。其次,鉴于估计和建模误差可能导致迭代过程中的偏差,我们采用小扰动输入到状态稳定性技术验证了所提出算法的鲁棒性。即使存在扰动,也可确保收敛到最优解的附近。最后,为放宽对代理动力学精确知识的限制,我们在双环迭代框架中采用积分强化学习技术开发了数据驱动的方法。提供了一个数值示例,以演示所提出算法的有效性。
引用
@article{arxiv.2502.20029,
title = {Robust Mean Field Social Control: A Unified Reinforcement Learning Framework},
author = {Zhenhui Xu and Jiayu Chen and Bing-Chang Wang and Yuhu Wu and Tielong Shen},
journal= {arXiv preprint arXiv:2502.20029},
year = {2025}
}