中文

基于可行性一致性的安全强化学习表示学习

机器学习 2024-06-14 v2

摘要

在安全强化学习领域,满足安全约束与优化奖励性能之间的平衡是一大挑战。其关键障碍在于安全约束的估计,通常比奖励指标更难估计,因为约束信号稀疏。为此,我们提出一种名为 Feasibility Consistent Safe Reinforcement Learning(可行性一致性安全强化学习)的新型框架。该框架将表示学习与可行性导向目标结合,用于从原始状态中识别和提取与安全相关的信息。我们运用自监督学习技术和更易学习的安全指标,增强策略学习和约束估计。跨多个向量状态和图像基任务的实证评估表明,该方法能够学习更好的安全感知嵌入,优于以往的表示学习基线方法。

关键词

引用

@article{arxiv.2405.11718,
  title  = {Feasibility Consistent Representation Learning for Safe Reinforcement Learning},
  author = {Zhepeng Cen and Yihang Yao and Zuxin Liu and Ding Zhao},
  journal= {arXiv preprint arXiv:2405.11718},
  year   = {2024}
}

备注

ICML 2024