用于强化学习中保持活性防护的自适应GR(1)规约修复
人工智能
2026-02-23 v2
摘要
防护被广泛用于在强化学习中强制执行安全性,确保智能体的行为符合形式化规约。然而,经典的防护方法通常是静态的,因为它们假设固定的逻辑规约和手工制作的抽象。虽然这些静态防护在名义假设下提供了安全性,但当环境假设被违反时,它们无法适应。在本文中,我们开发了一个基于1阶广义反应性规约的自适应防护框架,GR(1)是线性时序逻辑的一个可处理且富有表现力的片段,它同时捕获了安全性和活性属性。我们的方法在运行时检测环境假设违反,并采用归纳逻辑编程来自动在线修复GR(1)规约,以系统且可解释的方式进行。这确保了防护能够优雅地演化,保证活性是可实现的,并且仅在必要时最小程度地削弱目标。我们考虑了两个案例研究:Minepump和Atari Seaquest;结果表明:(i) 在优化辅助奖励时,静态符号控制器通常严重次优,并且 (ii) 配备了我们自适应防护的强化学习智能体与静态防护相比,保持了接近最优的奖励和完美的逻辑合规性。
引用
@article{arxiv.2511.02605,
title = {Adaptive GR(1) Specification Repair for Liveness-Preserving Shielding in Reinforcement Learning},
author = {Tiberiu-Andrei Georgescu and Alexander W. Goodall and Dalal Alrajeh and Francesco Belardinelli and Sebastian Uchitel},
journal= {arXiv preprint arXiv:2511.02605},
year = {2026}
}