中文

FAWAC:基于可行性信息的优势加权回归用于离线强化学习中的持久安全

机器学习 2024-12-13 v1

摘要

安全离线强化学习旨在仅使用离线数据训练,学习出在满足安全约束条件下最大化累积奖励的策略。其关键挑战在于,在策略遇到离分布状态和动作时,在部署过程中平衡安全性与性能表现。为此,我们引入可行性信息优势加权演员-评论家方法(FAWAC),该方法在受约束马尔可夫决策过程(CMDP)中优先确保持久安全。FAWAC针对离线数据集制定可行性条件,实现了在非参数策略空间中的安全策略更新,随后投影到参数空间进行受约束演员训练。通过在优势加权回归中引入代价优势项,FAWAC确保在最大化性能的同时遵守安全约束。此外,我们提出了应对更具挑战性问题的策略,即包含诱惑数据集,其中轨迹主要是高奖励但不安全的。在标准基准测试上的经验评估表明,FAWAC取得了优异结果,有效地在静态数据集上实现了安全性与性能之间的平衡。

关键词

引用

@article{arxiv.2412.08880,
  title  = {FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning},
  author = {Prajwal Koirala and Zhanhong Jiang and Soumik Sarkar and Cody Fleming},
  journal= {arXiv preprint arXiv:2412.08880},
  year   = {2024}
}