守护者:解耦强化学习中的探索与安全
机器学习
2025-10-28 v1 人工智能
摘要
混合离线-在线强化学习(O2O RL)旨在兼具样本效率和稳健探索,但因离线与在线数据之间的分布迁移导致训练不稳定。我们提出 RLPD-GX 框架,通过解耦策略优化与安全 enforcement 实现:奖励寻求者自由探索,而基于投影的守护者确保规则一致执行并进行安全价值备份。该设计保留了在线交互的探索价值,避免保守策略的崩溃。为进一步稳定训练,我们提出动态课程方案,逐步扩展时间范围并退化离线-在线数据混合。我们通过守护 Bellman 算子的收缩性质证明了收敛性,实验在 Atari-100k 上实现最先进性能,归一化平均得分 3.02(相较于现有混合方法提升 45%),且安全性和稳定性更佳。除 Atari 外,消融实验在安全关键任务和长期程任务中均表现出一致提升,凸显该设计的通用性。广泛而详尽的结果表明,解耦式安全 enforcement 是实现稳健 O2O 强化学习的简单而原则化之路,为在强化学习中调和探索与安全提供更广泛的范式。
引用
@article{arxiv.2510.22859,
title = {Guardian: Decoupling Exploration from Safety in Reinforcement Learning},
author = {Kaitong Cai and Jusheng Zhang and Jing Yang and Keze Wang},
journal= {arXiv preprint arXiv:2510.22859},
year = {2025}
}