中文

SafeOR-Gym:面向实际运筹学问题的安全强化学习算法基准测试套件

机器学习 2025-06-04 v1

摘要

现有的多数安全强化学习(RL)基准侧重于机器人和控制任务,对涉及结构化约束、混合整数决策和工业复杂性的高风险领域相关性有限。这一差距阻碍了安全 RL 在能源系统、制造业和供应链等关键领域的进步与部署。为了解决这一局限性,我们提出了 SafeOR-Gym,这是一个包含九个运筹学(OR)环境的基准测试套件,专为复杂约束下的安全 RL 量身定制。每个环境都捕捉了一个现实的规划、调度或控制问题,其特征包括基于成本的约束违反、规划视野以及混合离散-连续动作空间。该套件与 OmniSafe 提供的受约束马尔可夫决策过程(CMDP)接口无缝集成。我们在这些环境中评估了多种最先进的安全 RL 算法,揭示了广泛的性能表现:虽然有些任务易于处理,但其他任务暴露了当前方法的根本局限性。SafeOR-Gym 提供了一个具有挑战性且实用的测试平台,旨在促进未来在面向现实世界决策问题的安全 RL 研究。SafeOR-Gym 框架及所有配套代码可在以下地址获取:https://github.com/li-group/SafeOR-Gym。

关键词

引用

@article{arxiv.2506.02255,
  title  = {SafeOR-Gym: A Benchmark Suite for Safe Reinforcement Learning Algorithms on Practical Operations Research Problems},
  author = {Asha Ramanujam and Adam Elyoumi and Hao Chen and Sai Madhukiran Kompalli and Akshdeep Singh Ahluwalia and Shraman Pal and Dimitri J. Papageorgiou and Can Li},
  journal= {arXiv preprint arXiv:2506.02255},
  year   = {2025}
}