基于可行性引导扩散模型的安全离线强化学习
机器学习
2024-01-22 v1 人工智能
机器人学
摘要
安全离线强化学习是绕过高风险在线交互以实现安全策略学习的一种极具前景的方法。现有大多数方法仅施加软约束,即将安全违规的期望约束在预定阈值之下。这可能导致潜在的不安全后果,因此在安全关键场景中不可接受。另一种选择是施加零违规的硬约束。然而,这在离线环境中极具挑战性,因为它需要在三个高度复杂且相互关联的方面之间取得适当平衡:安全约束满足、奖励最大化以及离线数据集施加的行为正则化。有趣的是,我们通过安全控制理论的可达性分析发现,硬安全约束可以等价转化为在给定离线数据集下识别最大可行区域。这将原始的三部曲问题无缝转化为依赖于可行性的目标,即在可行区域内最大化奖励值,同时在不可行区域内最小化安全风险。受此启发,我们提出了 FISOR(可行性引导的安全离线强化学习),它允许安全约束遵守、奖励最大化和离线策略学习通过三个解耦的过程实现,同时提供强大的安全性能与稳定性。在 FISOR 中,转化后优化问题的最优策略可以以加权行为克隆的特殊形式导出。因此,我们提出了一种新颖的能量引导扩散模型,该模型不需要训练复杂的时变分类器来提取策略,极大简化了训练过程。我们在安全离线强化学习的 DSRL 基准上将 FISOR 与基线方法进行了比较。评估结果表明,FISOR 是唯一能够在所有任务中保证安全满足的方法,同时在大多数任务中取得了最高回报。
引用
@article{arxiv.2401.10700,
title = {Safe Offline Reinforcement Learning with Feasibility-Guided Diffusion Model},
author = {Yinan Zheng and Jianxiong Li and Dongjie Yu and Yujie Yang and Shengbo Eben Li and Xianyuan Zhan and Jingjing Liu},
journal= {arXiv preprint arXiv:2401.10700},
year = {2024}
}
备注
ICLR 2024, 30pages, 11 figures