中文

求解状态依赖切换系统最优控制的有限时域多智能体强化学习

系统与控制 2024-11-25 v3 系统与控制

摘要

本文提出一种状态依赖多智能体深度确定性策略梯度(SMADDPG)方法,用于学习区域切换系统的最优控制策略。我们观察到该方法具有良好的性能,并利用一些简化假设,以严格的数学语言对其进行解释,以阐明其思想并将其应用于一些典型示例。通过强化学习,我们在两个定制的、具有一维和二维状态空间的演示环境中,将基于切换学习的多智能体方法的性能与原始DDPG进行了比较。

关键词

引用

@article{arxiv.2312.04767,
  title  = {Finite Horizon Multi-Agent Reinforcement Learning in Solving Optimal Control of State-Dependent Switched Systems},
  author = {Mi Zhou and Jiazhi Li and Masood Mortazavi and Ning Yan and Chaouki Abdallah},
  journal= {arXiv preprint arXiv:2312.04767},
  year   = {2024}
}