将安全性嵌入强化学习:信任区域方法的新视角
机器学习
2025-08-18 v4 系统与控制
系统与控制
摘要
强化学习(RL)智能体能够解决多种任务,但常常表现出不安全行为。约束马尔可夫决策过程(CMDP)通过强制执行安全约束来解决这一问题,然而现有方法要么牺牲奖励最大化,要么允许不安全的训练。我们提出了约束信任区域策略优化(C-TRPO),通过重塑策略空间的几何结构来确保信任区域仅包含安全策略,从而在训练过程中保证约束满足。我们分析了其理论性质以及与TRPO、自然策略梯度(NPG)和约束策略优化(CPO)的联系。实验表明,C-TRPO在保持竞争力回报的同时减少了约束违反。
引用
@article{arxiv.2411.02957,
title = {Embedding Safety into RL: A New Take on Trust Region Methods},
author = {Nikola Milosevic and Johannes Müller and Nico Scherf},
journal= {arXiv preprint arXiv:2411.02957},
year = {2025}
}
备注
Accepted at ICML 2025