中文

通过分层自适应机会约束防护实现安全强化学习

机器人学 2024-03-07 v2

摘要

在强化学习(RL)中确保安全性(通常表述为约束马尔可夫决策过程(CMDP))对于现实世界的探索应用至关重要。当前处理 CMDP 的方法难以平衡最优性与可行性:直接优化方法无法确保训练过程中的状态级安全,而基于投影的方法通过冗长迭代低效地修正动作。为应对这些挑战,我们提出自适应机会约束防护(ACS),一种自适应的、无模型的安全 RL 算法,使用安全恢复率作为代理机会约束,在探索期间及收敛后迭代地确保安全。理论分析表明,该松弛的概率约束充分保证了到安全集的正向不变性。在模拟与真实世界安全关键任务上的大量实验证明其能在保持最优性(+23.8%)、鲁棒性及随机真实环境中的快速响应的同时有效实施安全(近乎零违例)。

关键词

引用

@article{arxiv.2310.03379,
  title  = {Safe Reinforcement Learning via Hierarchical Adaptive Chance-Constraint Safeguards},
  author = {Zhaorun Chen and Zhuokai Zhao and Tairan He and Binhao Chen and Xuhao Zhao and Liang Gong and Chengliang Liu},
  journal= {arXiv preprint arXiv:2310.03379},
  year   = {2024}
}

备注

8 pages, 6 figures, 3 tables