通过不确定性调制降低安全评论员的过于保守
机器学习
2026-02-19 v2
摘要
确保强化学习 (RL) 代理在真实系统中的安全探索至关重要。然而,现有方法难以在安全性和任务性能之间取得恰当的平衡:严格强制安全的方法往往削弱任务性能,而以奖励为主的方法则常常导致安全约束被频繁违反,产生平坦的成本景观,使梯度变平,导致策略改进停滞。我们引入不确定性安全评论员 (USC),一种新方法,将不确定性调制和细化集成到评论员训练中。通过在不确定性和高成本区域集中保守性,在安全区域保持锐利梯度,USC 使策略能够实现有效的奖励-安全权衡。大量实验表明,USC 将安全违规降低约 40%,同时保持或提高奖励水平,将预测与真实成本梯度之间的误差降低约 83%,打破了安全性与性能之间的 prevailing trade-off,为可扩展的安全 RL 铺平了道路。
引用
@article{arxiv.2510.18478,
title = {Safe But Not Sorry: Reducing Over-Conservatism in Safety Critics via Uncertainty-Aware Modulation},
author = {Daniel Bethell and Simos Gerasimou and Radu Calinescu and Calum Imrie},
journal= {arXiv preprint arXiv:2510.18478},
year = {2026}
}
备注
Accepted into AAMAS '26