基于可行性一致性的安全强化学习表示学习
机器学习
2024-06-14 v2
摘要
在安全强化学习领域,满足安全约束与优化奖励性能之间的平衡是一大挑战。其关键障碍在于安全约束的估计,通常比奖励指标更难估计,因为约束信号稀疏。为此,我们提出一种名为 Feasibility Consistent Safe Reinforcement Learning(可行性一致性安全强化学习)的新型框架。该框架将表示学习与可行性导向目标结合,用于从原始状态中识别和提取与安全相关的信息。我们运用自监督学习技术和更易学习的安全指标,增强策略学习和约束估计。跨多个向量状态和图像基任务的实证评估表明,该方法能够学习更好的安全感知嵌入,优于以往的表示学习基线方法。
引用
@article{arxiv.2405.11718,
title = {Feasibility Consistent Representation Learning for Safe Reinforcement Learning},
author = {Zhepeng Cen and Yihang Yao and Zuxin Liu and Ding Zhao},
journal= {arXiv preprint arXiv:2405.11718},
year = {2024}
}
备注
ICML 2024