中文

SB-TRPO:面向硬约束安全强化学习的方法

机器学习 2026-05-11 v3 人工智能

摘要

在安全关键领域,强化学习 (RL) 智能体在完成任务时通常必须满足严格的零代价安全约束。现有的无模型方法往往要么无法实现接近零的安全违规,要么变得过于保守。我们引入了安全偏置信任域策略优化 (Safety-Biased Trust Region Policy Optimisation, SB-TRPO),这是一种用于硬约束 RL 的原理性算法,能够动态平衡代价降低与奖励提升。在每一步中,SB-TRPO 通过奖励和代价自然策略梯度的动态凸组合进行更新,在确保固定比例的最优代价降低的同时,利用剩余的更新容量来提升奖励。该方法在安全性方面提供了局部进展的形式化保证,并且只要梯度适当对齐,仍能持续改善奖励。在标准和具有挑战性的 Safety Gymnasium 任务上的实验表明,SB-TRPO 在硬约束机制下始终实现了安全性与任务性能的最佳平衡。

关键词

引用

@article{arxiv.2512.23770,
  title  = {SB-TRPO: Towards Safe Reinforcement Learning with Hard Constraints},
  author = {Dominik Wagner and Ankit Kanwar and Luke Ong},
  journal= {arXiv preprint arXiv:2512.23770},
  year   = {2026}
}