中文

System III:利用领域知识学习安全约束

机器学习 2023-04-25 v1

摘要

强化学习智能体天然地通过广泛探索来学习。在安全关键\textit{安全关键}领域中,探索代价高昂且可能不安全。本文提出一种新框架,用于融入领域知识以帮助引导安全探索并提升样本效率。先前的方法施加约束(如神经网络中的正则化参数),依赖大量样本集,且通常不适合智能体几乎总应避免不安全动作的 safety-critical 领域。在我们称为System III\textit{System III}的方法中(其受心理学家关于大脑System I\textit{System I}System II\textit{System II}概念的启发),我们以一阶逻辑形式表示安全领域专家知识。我们通过状态向量空间中的 p-范数评估这些约束的满足情况。在我们的表述中,约束类似于探索期间必须避免的危险、物体和状态区域。我们在 OpenAI 的 Gym 和 Safety-Gym 环境中评估了所提方法的有效性。在所有任务(包括经典控制与安全的博弈)中,我们表明我们的方法实现了更安全的探索和样本效率。

关键词

引用

@article{arxiv.2304.11593,
  title  = {System III: Learning with Domain Knowledge for Safety Constraints},
  author = {Fazl Barez and Hosien Hasanbieg and Alesandro Abbate},
  journal= {arXiv preprint arXiv:2304.11593},
  year   = {2023}
}