中文

离线安全强化学习的边界到区域监督

机器学习 2025-10-01 v1 人工智能 机器人学

摘要

离线安全强化学习旨在从静态数据集中学习满足预定义安全约束的策略。现有基于序列模型的方法将动作生成条件化于对称的输入令牌,即目标回报和成本回报,忽略了它们内在的不对称性:目标回报(RTG)作为一个灵活的性能目标,而成本回报(CTG)则应代表一个刚性的安全边界。这种对称的条件化导致了不可靠的约束满足,尤其是在遇到分布外的成本轨迹时。为了解决这个问题,我们提出了边界到区域(B2R)框架,该框架通过成本信号重对齐实现非对称条件化。B2R将CTG重新定义为固定安全预算下的边界约束,统一了所有可行轨迹的成本分布,同时保留了奖励结构。结合旋转位置嵌入,它增强了安全区域内的探索。实验结果表明,B2R在38个安全关键任务中的35个上满足了安全约束,同时实现了优于基线方法的奖励性能。这项工作突显了对称令牌条件化的局限性,并为将序列模型应用于安全强化学习建立了一种新的理论和实践方法。我们的代码可在https://github.com/HuikangSu/B2R获取。

关键词

引用

@article{arxiv.2509.25727,
  title  = {Boundary-to-Region Supervision for Offline Safe Reinforcement Learning},
  author = {Huikang Su and Dengyun Peng and Zifeng Zhuang and YuHan Liu and Qiguang Chen and Donglin Wang and Qinghe Liu},
  journal= {arXiv preprint arXiv:2509.25727},
  year   = {2025}
}

备注

NeurIPS 2025