中文

将安全性嵌入强化学习:信任区域方法的新视角

机器学习 2025-08-18 v4 系统与控制 系统与控制

摘要

强化学习(RL)智能体能够解决多种任务,但常常表现出不安全行为。约束马尔可夫决策过程(CMDP)通过强制执行安全约束来解决这一问题,然而现有方法要么牺牲奖励最大化,要么允许不安全的训练。我们提出了约束信任区域策略优化(C-TRPO),通过重塑策略空间的几何结构来确保信任区域仅包含安全策略,从而在训练过程中保证约束满足。我们分析了其理论性质以及与TRPO、自然策略梯度(NPG)和约束策略优化(CPO)的联系。实验表明,C-TRPO在保持竞争力回报的同时减少了约束违反。

关键词

引用

@article{arxiv.2411.02957,
  title  = {Embedding Safety into RL: A New Take on Trust Region Methods},
  author = {Nikola Milosevic and Johannes Müller and Nico Scherf},
  journal= {arXiv preprint arXiv:2411.02957},
  year   = {2025}
}

备注

Accepted at ICML 2025