中文

面向安全强化学习的未知时间约束策略联合学习

系统与控制 2023-05-02 v1 机器学习 系统与控制

摘要

在许多现实应用中,强化学习(RL)算法的安全约束或是未知,或是未明确定义。我们提出了一种框架,可在此类环境中同时学习安全约束与最优RL策略,并附有理论保证。我们的方法将逻辑约束RL算法与进化算法相融合,以合成信号时序逻辑(STL)规约。该框架以若干定理为基础,这些定理确立了联合学习过程的收敛性,并给出了所发现策略与真实最优策略之间的误差界。我们在网格世界环境中展示了我们的框架,成功识别出可接受的安全约束与RL策略,同时证明了我们的定理在实践中的有效性。

关键词

引用

@article{arxiv.2305.00576,
  title  = {Joint Learning of Policy with Unknown Temporal Constraints for Safe Reinforcement Learning},
  author = {Lunet Yifru and Ali Baheri},
  journal= {arXiv preprint arXiv:2305.00576},
  year   = {2023}
}

备注

Accepted at the "Bridging the Gap Between AI Planning and Reinforcement Learning (PRL)" workshop at ICAPS 2023