中文

SaFormer:一种面向离线安全强化学习的条件序列建模方法

机器学习 2023-01-31 v1

摘要

离线安全强化学习(RL)对于在现实应用中部署智能体具有重大实际意义。然而,对于传统方法而言,从固定数据集中获取满足约束的策略并非易事。更糟糕的是,学到的约束是静态的,当在线安全要求变化时可能失效。在本文中,我们提出一种新颖的离线安全 RL 方法,称为 SaFormer,其通过条件序列建模解决上述问题。与现有序列模型不同,我们提出与代价相关的令牌以限制动作空间,以及一种后验安全验证以显式地强制执行约束。具体而言,SaFormer 以最大剩余代价为条件执行两阶段自回归,以生成可行候选。随后其过滤掉不安全尝试,并执行具有最高期望回报的最优动作。大量实验证明了 SaFormer 的有效性,其特点为:(1)在收紧约束满足的同时具有竞争力的回报;(2)无需重新训练即可适应离线数据的范围内代价值;(3)对超出当前数据集的约束具有泛化能力。

关键词

引用

@article{arxiv.2301.12203,
  title  = {SaFormer: A Conditional Sequence Modeling Approach to Offline Safe Reinforcement Learning},
  author = {Qin Zhang and Linrui Zhang and Haoran Xu and Li Shen and Bowen Wang and Yongzhe Chang and Xueqian Wang and Bo Yuan and Dacheng Tao},
  journal= {arXiv preprint arXiv:2301.12203},
  year   = {2023}
}