中文

基于 Successor Features 的安全约束策略迁移

机器学习 2022-11-11 v1

摘要

在本工作中,我们关注强化学习中的安全策略迁移问题:我们寻求在学习具有指定约束的新任务时利用现有策略。该问题对于安全关键型应用十分重要,因为在这些应用中交互成本高昂,且无约束策略可能导致不可取或危险的后果,例如与人类交互的物理机器人。我们提出了一种约束马尔可夫决策过程 (CMDP) 公式,可同时实现策略迁移与对安全约束的遵守。我们的公式将任务目标与安全考量清晰分离,并允许指定多种多样的约束。我们的方法依赖于通过拉格朗日公式将广义策略改进推广至约束环境的新型扩展。我们设计了一种双重优化算法,用于估计目标任务的最优对偶变量,从而能够安全地迁移从源任务学到的 successor features 导出的策略。我们在模拟环境中的实验表明,我们的方法是有效的;在考虑安全约束时,它访问不安全状态的频率更低,并且优于其他替代的 state-of-the-art 方法。

关键词

引用

@article{arxiv.2211.05361,
  title  = {Safety-Constrained Policy Transfer with Successor Features},
  author = {Zeyu Feng and Bowen Zhang and Jianxin Bi and Harold Soh},
  journal= {arXiv preprint arXiv:2211.05361},
  year   = {2022}
}