中文

安全强化学习中约束形式的综述

机器学习 2024-05-09 v2 人工智能

摘要

在将强化学习 (RL) 应用于现实世界问题时,安全性至关重要。因此,安全强化学习已成为在纳入安全概念的同时优化智能体策略的一种基本且强大的范式。一种流行的安全强化学习方法基于约束准则,旨在最大化期望累积奖励并满足特定的安全约束。尽管近期在增强强化学习安全性方面做出了努力,但对这一领域的系统性理解仍然困难。这一挑战源于约束表示的多样性及其相互关系的缺乏探索。为了弥合这一知识差距,我们对代表性的约束形式进行了全面综述,并精心挑选了专为每种形式设计的算法。此外,我们阐明了揭示常见问题形式之间数学相互关系的理论基础。最后,我们讨论了安全强化学习研究的现状与未来方向。

关键词

引用

@article{arxiv.2402.02025,
  title  = {A Survey of Constraint Formulations in Safe Reinforcement Learning},
  author = {Akifumi Wachi and Xun Shen and Yanan Sui},
  journal= {arXiv preprint arXiv:2402.02025},
  year   = {2024}
}

备注

Accepted at IJCAI-24 survey track