中文

模拟机械臂中的安全强化学习

机器人学 2024-03-01 v2 人工智能 机器学习

摘要

强化学习 (RL) 智能体需要探索其环境以学习最优策略。在许多环境和任务中,安全性至关重要。模拟器的广泛使用提供了诸多优势,包括安全探索,这在 RL 系统需要直接在物理环境中训练时(例如人机交互)是不可避免的。流行的 Safety Gym 库提供了三种移动智能体类型,它们可以在考虑各种安全约束的同时学习目标导向任务。在本文中,我们通过创建一个配备 Panda 机械臂的定制环境来扩展安全 RL 算法的适用性,在该环境中可以测试 Safety Gym 算法。我们使用流行的 PPO 算法进行了初步实验,比较了基线版本与受约束版本,结果表明受约束版本能够学习到同样好的策略,同时更好地遵守安全约束,并且如预期般需要更长的训练时间。

关键词

引用

@article{arxiv.2312.09468,
  title  = {Safe Reinforcement Learning in a Simulated Robotic Arm},
  author = {Luka Kovač and Igor Farkaš},
  journal= {arXiv preprint arXiv:2312.09468},
  year   = {2024}
}

备注

4 pages, 2 figures. Appeared in 2023 International Conference on Artificial Neural Networks (ICANN) proceedings. Published version copyrighted by Springer. This work was funded by the Horizon Europe Twinning project TERAIS, G.A. number 101079338 and in part by the national project APVV-21-0105. Link to the code: https://zenodo.org/doi/10.5281/zenodo.10694747