Safety-Gymnasium:一个统一的安全强化学习基准
人工智能
2024-10-08 v3 机器学习
摘要
人工智能(AI)系统具有推动社会进步的巨大潜力。然而,由于其显著的安全隐患,其部署常常面临障碍。安全强化学习(SafeRL)作为一种解决方案,在优化策略的同时遵守多重约束,从而应对将强化学习应用于安全关键场景的挑战。在本文中,我们提出一个名为 Safety-Gymnasium 的环境套件,涵盖单智能体与多智能体场景中的安全关键任务,接受向量与纯视觉输入。此外,我们提供一个名为安全策略优化(SafePO)的算法库,包含 16 种最先进的 SafeRL 算法。该综合库可作为研究界的验证工具。通过引入此基准,我们旨在促进安全性能的评估与比较,从而推动强化学习朝向更安全、更可靠和负责任的实际应用发展。本项目的网站可通过 https://sites.google.com/view/safety-gymnasium 访问。
引用
@article{arxiv.2310.12567,
title = {Safety-Gymnasium: A Unified Safe Reinforcement Learning Benchmark},
author = {Jiaming Ji and Borong Zhang and Jiayi Zhou and Xuehai Pan and Weidong Huang and Ruiyang Sun and Yiran Geng and Yifan Zhong and Juntao Dai and Yaodong Yang},
journal= {arXiv preprint arXiv:2310.12567},
year = {2024}
}
备注
Published at NeurIPS 2023