中文

具有瞬时约束的安全强化学习:激进探索的作用

机器学习 2023-12-25 v1

摘要

本文研究了具有线性函数逼近且在硬瞬时约束下的安全强化学习(safe RL),其中每一步都必须避免不安全动作。现有研究已考虑了具有硬瞬时约束的安全 RL,但其方法依赖于几个关键假设:(i)(i) RL 智能体知道{\it 每个}状态的安全动作集,或者知道所有状态 - 动作 - 状态三元组均安全的{\it 安全图};以及 (ii)(ii) 约束/代价函数是{\it 线性}的。在本文中,我们在没有假设 (i)(i) 的情况下考虑具有瞬时硬约束的安全 RL,并将 (ii)(ii) 推广到再生核希尔伯特空间(RKHS)。我们提出的算法 LSVI-AE 在代价函数为线性时实现了 \cO~(d3H4K)\tilde{\cO}(\sqrt{d^3H^4K}) 的遗憾和 \cO~(HdK)\tilde{\cO}(H \sqrt{dK}) 的硬约束违反,而在代价函数属于 RKHS 时实现了 \cO(HγKK)\cO(H\gamma_K \sqrt{K}) 的硬约束违反。这里 KK 是学习视界,HH 是每集的长度,γK\gamma_K 是用于逼近代价函数的核的信息增益。我们的结果实现了对学习视界 KK 的最优依赖,匹配了我们在本文中提供的下界,并证明了 LSVI-AE 的效率。值得注意的是,我们方法的设计鼓励激进的策略探索,为具有通用代价函数且无安全动作先验知识的安全 RL 提供了独特的视角,这可能具有独立的研究价值。

关键词

引用

@article{arxiv.2312.14470,
  title  = {Safe Reinforcement Learning with Instantaneous Constraints: The Role of Aggressive Exploration},
  author = {Honghao Wei and Xin Liu and Lei Ying},
  journal= {arXiv preprint arXiv:2312.14470},
  year   = {2023}
}