逻辑约束的强化学习
机器学习
2019-02-19 v8 计算机科学中的逻辑
摘要
我们提出了首个无模型强化学习(RL)算法,用于为未知马尔可夫决策过程(MDP)合成满足线性时序性质的策略。给定的时序性质被转换为极限确定性 Büchi 自动机(LDBA),并根据所得 LDBA 在 MDP 的状态-动作对上定义鲁棒奖励函数。借助该奖励函数,策略合成过程被给定规约所“约束”。这些约束引导 MDP 探索,仅考虑与满足 LTL 性质相关的 MDP 部分,从而最小化求解时间。该方法通过避免对整个状态空间进行穷举更新,提升了性能与可扩展性,而动态规划等标准方法由于需要在内存中存储完整模型导致内存需求过大,其效率受到影响。此外,我们表明该 RL 过程建立了一个局部值迭代方法,以在 MDP 任意给定状态下高效计算满足给定性质的最大概率。我们证明,若存在这样的策略,我们的算法保证能找到其轨迹以概率方式满足 LTL 性质的策略,并且我们还表明即使 LTL 性质无法被满足,我们的方法也能产生合理的控制策略。该算法的性能通过一组数值算例进行了评估。我们观察到,与现有方法相比,合成所需的迭代次数减少了一个数量级。
引用
@article{arxiv.1801.08099,
title = {Logically-Constrained Reinforcement Learning},
author = {Mohammadhosein Hasanbeig and Alessandro Abate and Daniel Kroening},
journal= {arXiv preprint arXiv:1801.08099},
year = {2019}
}