中文

Controlgym:用于强化学习算法基准测试的大规模控制环境

系统与控制 2024-04-25 v2 人工智能 计算工程、金融与科学 机器学习 系统与控制 最优化与控制

摘要

我们推出 controlgym,一个包含三十六个工业控制场景和十个基于无限维偏微分方程(PDE)的控制问题的库。controlgym 集成于 OpenAI Gym/Gymnasium(Gym)框架内,可直接应用 stable-baselines3 等标准强化学习(RL)算法。我们的控制环境以现实世界控制应用为动机,以具有连续、无界动作与观测空间的环境补充 Gym 中的环境。此外,PDE 控制环境独特地允许用户在保持系统内在动力学的同时将系统状态维数扩展到无穷。该特性对于评估 RL 控制算法的可扩展性至关重要。本项目服务于动力学与控制学习(L4DC)社区,旨在探索关键问题:RL 算法在学习控制策略中的收敛性;基于学习的控制器的稳定性与鲁棒性问题;以及 RL 算法向高维乃至潜在无限维系统的可扩展性。我们在 https://github.com/xiangyuan-zhang/controlgym 开源了 controlgym 项目。

关键词

引用

@article{arxiv.2311.18736,
  title  = {Controlgym: Large-Scale Control Environments for Benchmarking Reinforcement Learning Algorithms},
  author = {Xiangyuan Zhang and Weichao Mao and Saviz Mowlavi and Mouhacine Benosman and Tamer Başar},
  journal= {arXiv preprint arXiv:2311.18736},
  year   = {2024}
}

备注

25 pages, 16 figures