求解状态依赖切换系统最优控制的有限时域多智能体强化学习
系统与控制
2024-11-25 v3 系统与控制
摘要
本文提出一种状态依赖多智能体深度确定性策略梯度(SMADDPG)方法,用于学习区域切换系统的最优控制策略。我们观察到该方法具有良好的性能,并利用一些简化假设,以严格的数学语言对其进行解释,以阐明其思想并将其应用于一些典型示例。通过强化学习,我们在两个定制的、具有一维和二维状态空间的演示环境中,将基于切换学习的多智能体方法的性能与原始DDPG进行了比较。
引用
@article{arxiv.2312.04767,
title = {Finite Horizon Multi-Agent Reinforcement Learning in Solving Optimal Control of State-Dependent Switched Systems},
author = {Mi Zhou and Jiazhi Li and Masood Mortazavi and Ning Yan and Chaouki Abdallah},
journal= {arXiv preprint arXiv:2312.04767},
year = {2024}
}