中文

SDGym:基于系统动力学模型的低代码强化学习环境

机器学习 2024-08-26 v2

摘要

理解算法干预对社会的长期影响对于实现负责任AI至关重要。传统的评估策略常因社会复杂、自适应和动态的本质而不足。虽然强化学习(RL)可作为在动态环境中优化决策的强有力方法,但现实环境设计的困难仍是构建在实用环境中表现稳健的智能体的障碍。为解决此问题,我们利用系统动力学(SD)领域作为一种补充方法,其融合了协作式仿真模型规范实践。我们介绍了SDGym,一个构建于OpenAI Gym框架上的低代码库,能够基于SD仿真模型生成自定义RL环境。通过可行性研究,我们验证了可由已有SD模型和少量配置代码生成规范良好、丰富的RL环境。我们使用电动汽车采纳问题的SD模型展示了SDGym环境的能力。我们比较了PySD和BPTK-Py两个SD仿真器的一致性,并使用Acme框架训练了D4PG智能体以展示学习和环境交互。我们的初步发现强调了SD的双重潜力:改进RL环境设计,以及RL改进SD模型中的动态策略发现。通过开源SDGym,旨在促进进一步研究并推动SD与RL社群的采用,从而在这一新兴交叉空间中催化协作。

关键词

引用

@article{arxiv.2310.12494,
  title  = {SDGym: Low-Code Reinforcement Learning Environments using System Dynamics Models},
  author = {Emmanuel Klu and Sameer Sethi and DJ Passey and Donald Martin},
  journal= {arXiv preprint arXiv:2310.12494},
  year   = {2024}
}

备注

Presented at ISDC 2024, Bergen, Norway