约束满足传播:时序逻辑规划的非平稳策略综合
人工智能
2019-02-13 v3
摘要
当使用奖励函数捕获顺序时间约束目标状态之间的依赖关系时,会出现问题,因为必须禁止性地扩展状态空间以容纳成功实现的子目标历史。此外,基于平稳性假设导出的策略和值函数不易分解,导致奖励最大化与任务泛化之间的张力。我们展示了一种逻辑兼容方法,利用基于模型的环境动态知识和截止时间信息,直接推断由可复用平稳策略组成的非平稳策略。这些策略被构造为在尊重时变障碍的同时最大化满足时间敏感目标的概率。我们的方法显式维护两个不同空间:高层逻辑任务规范空间,其中任务变量被接地到马尔可夫决策过程的低层状态空间。任务层的可满足性计算通过类贝尔曼方程实现,该方程作用于关联两个空间间时间关系的张量;该方程求解一个值函数,可显式解释为在所综合非平稳策略下子目标满足的概率,我们称此方法为约束满足传播(CSP)。
引用
@article{arxiv.1901.10405,
title = {Constraint Satisfaction Propagation: Non-stationary Policy Synthesis for Temporal Logic Planning},
author = {Thomas J. Ringstrom and Paul R. Schrater},
journal= {arXiv preprint arXiv:1901.10405},
year = {2019}
}
备注
Preprint. In progress. 10 Pages