中文

面向离线安全强化学习的数据集与基准

机器学习 2023-06-19 v2 人工智能 机器人学

摘要

本文提出了一套专为离线安全强化学习(RL)挑战设计的综合基准套件,旨在促进安全学习算法在训练与部署阶段的发展与评估。我们的基准套件包含三个部分:1)精心构建的安全策略,2)D4RL风格的数据集及环境封装,3)高质量的离线安全RL基线实现。我们采用了由先进安全RL算法驱动的系统化数据收集流程,可在从机器人控制到自动驾驶的38个流行安全RL任务上生成多样化数据集。我们进一步引入了一系列数据后处理过滤器,能够修改每个数据集的多样性,从而模拟各种数据收集条件。此外,我们提供了流行离线安全RL算法的简洁且可扩展的实现,以加速该领域的研究。通过超过50000 CPU小时和800 GPU小时计算量的大量实验,我们在收集的数据集上评估并比较了这些基线算法的性能,揭示了它们的优势、局限性和潜在改进方向。我们的基准框架为研究人员与从业者提供了宝贵资源,促进了在安全关键应用中更鲁棒、更可靠的离线安全RL解决方案的发展。基准网站位于\url{www.offline-saferl.org}。

关键词

引用

@article{arxiv.2306.09303,
  title  = {Datasets and Benchmarks for Offline Safe Reinforcement Learning},
  author = {Zuxin Liu and Zijian Guo and Haohong Lin and Yihang Yao and Jiacheng Zhu and Zhepeng Cen and Hanjiang Hu and Wenhao Yu and Tingnan Zhang and Jie Tan and Ding Zhao},
  journal= {arXiv preprint arXiv:2306.09303},
  year   = {2023}
}

备注

22 pages.13 figures, 7 tables