均场 LQG 社会优化:基于强化学习的方法
最优化与控制
2025-11-11 v1
摘要
本文提出一种新型的无模型方法,用于解决存在乘子噪声的线性二次高斯均场社会控制问题。目标是通过求解两个代数 Riccati 方程 (ARE) 以及确定均场 (MF) 状态来实现社会最优,这两个都不需要知道所有代理人的 individual 系统动力学。在所提出的方法中,我们首先采用积分强化学习技术发展出两个无模型的迭代方程,分别收敛到随机 ARE 和诱导出的不定 ARE 的解。然后,通过获得的增益矩阵进行蒙特卡罗方法或通过测量数据进行系统识别来近似 MF 状态。值得注意的是,来自单个代理人的统一状态和输入样本用于两个迭代和识别程序,使方法在计算效率和可扩展性方面更具优势。最后,给出一个数值示例来演示所提出算法的有效性。
关键词
引用
@article{arxiv.2410.15119,
title = {Mean Field LQG Social Optimization: A Reinforcement Learning Approach},
author = {Zhenhui Xu and Bing-Chang Wang and Tielong Shen},
journal= {arXiv preprint arXiv:2410.15119},
year = {2025}
}
备注
16 pages