中文

受约束的乐观探索下的数据无偏安全强化学习

机器学习 2026-03-26 v1 机器人学

摘要

当安全性表述为累积成本的上限时,安全强化学习(RL)旨在学习在数据收集和部署过程中,在成本约束下最大化回报的策略。虽然数据无偏安全 RL 方法具有高样本效率,但由于成本中性探索和累积成本估计偏差, suffers from 约束违规。为此,我们提出受约束乐观探索 Q 学习(COX-Q),一种集成成本受限在线探索和保守离线分布式价值学习的数据无偏安全 RL 算法。首先,我们引入一种新的成本约束乐观探索策略,解决奖励和成本在动作空间中的梯度冲突,并自适应调整信任区域以控制训练成本。其次,我们采用截断分位数评论家来稳定成本价值学习。分位数评论家还用于量化认识不确定性以指导探索。在安全速度、安全导航和自动驾驶任务上的实验表明,COX-Q 实现了高样本效率、具竞争力的测试安全性能以及受控的数据收集成本。结果表明,COX-Q 是一种适用于安全关键应用的有前景的 RL 方法。

关键词

引用

@article{arxiv.2603.23889,
  title  = {Off-Policy Safe Reinforcement Learning with Constrained Optimistic Exploration},
  author = {Guopeng Li and Matthijs T. J. Spaan and Julian F. P. Kooij},
  journal= {arXiv preprint arXiv:2603.23889},
  year   = {2026}
}

备注

21 pages, 9 figures, accepted by ICLR 2026 poster