中文

在安全强化学习中处理长期安全性与不确定性

机器学习 2024-09-24 v2 机器人学

摘要

安全性是阻止强化学习技术在真实机器人上部署的关键问题之一。虽然大多数安全强化学习方法都不需要对约束和机器人动力学进行先验知识,仅依赖数据,但在复杂的真实场景中往往难以部署。相反,采用模型的方法,将约束和动力学的先验知识纳入学习框架,已被证明能够直接在真实机器人上部署学习算法。然而,虽然机器人动力学的近似模型往往可用,但安全约束是任务相关的,难以获得:它们可能难以以解析方式编码、计算成本太高,或事先难以构想出长期安全要求。在本文中,我们通过扩展安全探索方法 ATACOM,引入可学习的约束,重点关注确保长期安全性和处理不确定性。我们的方法在最终性能上与最先进的方法相当或更优,同时在训练期间保持更安全的行为。

关键词

引用

@article{arxiv.2409.12045,
  title  = {Handling Long-Term Safety and Uncertainty in Safe Reinforcement Learning},
  author = {Jonas Günster and Puze Liu and Jan Peters and Davide Tateo},
  journal= {arXiv preprint arXiv:2409.12045},
  year   = {2024}
}

备注

Preprint version of a paper accepted to the Conference on Robot Learning