中文

可验证且可组合的强化学习系统

机器学习 2022-05-16 v3 人工智能

摘要

我们提出了一种可验证且可组合的强化学习(RL)框架,其中一组 RL 子系统(每个学习完成一个独立子任务)被组合以达成整体任务。该框架由一个高层模型(表示为参数化马尔可夫决策过程(pMDP),用于规划与分析子系统的组合)以及低层子系统集合本身构成。通过定义子系统间的接口,该框架能够将任务规范(例如,以至少 0.95 的概率到达目标状态集)自动分解为各个子任务规范,即在满足其进入条件的给定前提下,以至少某最小概率达成子系统的退出条件。这进而允许对子系统进行独立训练与测试;若它们各自学到满足相应子任务规范的策略,则其组合被保证满足整体任务规范。反之,若所学策略无法全部满足子任务规范,我们给出一种方法,表述为在 pMDP 中寻找最优参数集的问题,以自动更新子任务规范从而考量已观察到的不足。结果是一个用于定义子任务规范并训练子系统以满足规范的迭代过程。作为一个额外益处,该过程能够在训练期间自动确定并聚焦于整体任务中特别困难或重要的组成部分。实验结果展示了所提框架的新颖能力。

关键词

引用

@article{arxiv.2106.05864,
  title  = {Verifiable and Compositional Reinforcement Learning Systems},
  author = {Cyrus Neary and Christos Verginis and Murat Cubuktepe and Ufuk Topcu},
  journal= {arXiv preprint arXiv:2106.05864},
  year   = {2022}
}

备注

Accepted for publication at ICAPS 2022. Changes since v1: An additional example with continuous states and actions has been added. Additional discussion has been added to the section presenting the algorithm, and to the section presenting the numerical experiments. Wording and formatting has been edited for consistency with the version published by AAAI press