具有瞬时约束的安全强化学习:激进探索的作用
机器学习
2023-12-25 v1
摘要
本文研究了具有线性函数逼近且在硬瞬时约束下的安全强化学习(safe RL),其中每一步都必须避免不安全动作。现有研究已考虑了具有硬瞬时约束的安全 RL,但其方法依赖于几个关键假设: RL 智能体知道{\it 每个}状态的安全动作集,或者知道所有状态 - 动作 - 状态三元组均安全的{\it 安全图};以及 约束/代价函数是{\it 线性}的。在本文中,我们在没有假设 的情况下考虑具有瞬时硬约束的安全 RL,并将 推广到再生核希尔伯特空间(RKHS)。我们提出的算法 LSVI-AE 在代价函数为线性时实现了 的遗憾和 的硬约束违反,而在代价函数属于 RKHS 时实现了 的硬约束违反。这里 是学习视界, 是每集的长度, 是用于逼近代价函数的核的信息增益。我们的结果实现了对学习视界 的最优依赖,匹配了我们在本文中提供的下界,并证明了 LSVI-AE 的效率。值得注意的是,我们方法的设计鼓励激进的策略探索,为具有通用代价函数且无安全动作先验知识的安全 RL 提供了独特的视角,这可能具有独立的研究价值。
引用
@article{arxiv.2312.14470,
title = {Safe Reinforcement Learning with Instantaneous Constraints: The Role of Aggressive Exploration},
author = {Honghao Wei and Xin Liu and Lei Ying},
journal= {arXiv preprint arXiv:2312.14470},
year = {2023}
}