自适应离线安全强化学习的解耦引导扩散
机器学习
2026-05-06 v2 人工智能
摘要
离线安全强化学习通常需要策略在部署时适应不同情节或单个情节中变化的安全预算。虽然扩散式规划器实现了灵活的轨迹生成,但现有的引导方案常将奖励改进和约束满足视为竞争性梯度目标,这可能导致在成本限制下安全性合规不可靠。我们将自适应安全轨迹生成重新解释为从受预算限制的轨迹分布中进行采样,预算限制轨迹区域,奖励在该区域内塑造偏好。这种视角激发了Safe Decoupled Guidance Diffusion(SDGD),其在成本限制上条件化classifier-free(无分类器)引导,以偏向满足指定限制的轨迹采样,同时使用奖励梯度引导以提高轨迹的回报。由于直接奖励引导可能在提高回报的同时将样本引导至更高累积成本的轨迹,我们引入Feasible Trajectory Relabeling(FTR)以重塑奖励目标,抑制此类方向。我们进一步提供了一种一阶采样时间分析,表明FTR在前缀恢复对齐条件下抑制了奖励引导导致的成本漂移。广泛的评估表明,SDGD在基线方法中实现了最强的安全合规,在94.7%(36/38)的任务中满足约束,同时在21个任务中获得了安全方法中最高的奖励。
引用
@article{arxiv.2605.02777,
title = {Decoupled Guidance Diffusion for Adaptive Offline Safe Reinforcement Learning},
author = {Rufeng Chen and Zhaofan Zhang and Zhejiang Yang and Hechang Chen and Sihong Xie},
journal= {arXiv preprint arXiv:2605.02777},
year = {2026}
}
备注
12 pages, 7 figures