SB-TRPO:面向硬约束安全强化学习的方法
机器学习
2026-05-11 v3 人工智能
摘要
在安全关键领域,强化学习 (RL) 智能体在完成任务时通常必须满足严格的零代价安全约束。现有的无模型方法往往要么无法实现接近零的安全违规,要么变得过于保守。我们引入了安全偏置信任域策略优化 (Safety-Biased Trust Region Policy Optimisation, SB-TRPO),这是一种用于硬约束 RL 的原理性算法,能够动态平衡代价降低与奖励提升。在每一步中,SB-TRPO 通过奖励和代价自然策略梯度的动态凸组合进行更新,在确保固定比例的最优代价降低的同时,利用剩余的更新容量来提升奖励。该方法在安全性方面提供了局部进展的形式化保证,并且只要梯度适当对齐,仍能持续改善奖励。在标准和具有挑战性的 Safety Gymnasium 任务上的实验表明,SB-TRPO 在硬约束机制下始终实现了安全性与任务性能的最佳平衡。
引用
@article{arxiv.2512.23770,
title = {SB-TRPO: Towards Safe Reinforcement Learning with Hard Constraints},
author = {Dominik Wagner and Ankit Kanwar and Luke Ong},
journal= {arXiv preprint arXiv:2512.23770},
year = {2026}
}