中文

安全状态增广对安全探索的影响

机器学习 2022-10-13 v2 人工智能

摘要

安全探索是无模型强化学习(RL)中一个具挑战性且重要的问题。通常安全代价是稀疏且未知的,这不可避免地导致约束违反——这一现象在安全关键应用中理想情况下应避免。我们通过用安全状态增广状态空间来解决此问题,该状态非负当且仅当约束被满足。该状态的值亦作为距约束违反的距离,而其初值表示可用安全预算。此思路使我们能导出在训练期间调度安全预算的策略。我们称我们的方法为Simmer(Safe policy IMproveMEnt for RL,安全策略改进),以反映这些调度的审慎特性。我们将此思路应用于两个安全RL问题:对平均代价施加约束的RL,以及对以概率一满足的代价施加约束的RL。我们的实验表明,"simmering",一种安全算法,可在两种设置下改善训练期间的安全性。我们进一步展示Simmer能稳定训练并提升带平均约束的安全RL性能。

关键词

引用

@article{arxiv.2206.02675,
  title  = {Effects of Safety State Augmentation on Safe Exploration},
  author = {Aivar Sootla and Alexander I. Cowen-Rivers and Jun Wang and Haitham Bou Ammar},
  journal= {arXiv preprint arXiv:2206.02675},
  year   = {2022}
}

备注

Published in Neurips 2022