利用安全评论家的反例引导强化学习系统修复
机器学习
2024-05-27 v1 计算机科学中的逻辑
摘要
朴素训练的深度强化学习智能体可能无法满足关键的安全约束。为了避免代价高昂的重新训练,我们可能希望修复先前训练的强化学习智能体以消除不安全行为。我们设计了一种利用安全评论家的反例引导修复算法,用于修复强化学习系统。该算法使用基于梯度的约束优化联合修复强化学习智能体和安全评论家。
引用
@article{arxiv.2405.15430,
title = {Counterexample-Guided Repair of Reinforcement Learning Systems Using Safety Critics},
author = {David Boetius and Stefan Leue},
journal= {arXiv preprint arXiv:2405.15430},
year = {2024}
}
备注
7 pages + references