线性时序逻辑规范下马尔可夫决策过程折扣奖励最优策略的综合
系统与控制
2021-03-24 v2 形式语言与自动机理论
系统与控制
摘要
我们提出一种方法,用于在通用线性时序逻辑(LTL)规范下,针对折扣马尔可夫决策过程,关于奖励函数寻找最优策略。先前的工作要么专注于在由语法上 co-safe LTL 指定的有限时长任务下最大化累积奖励目标,要么专注于在持久性(例如监视)任务下最大化平均奖励。本文通过引入一对占用测度分别表达 LTL 满足目标和期望折扣奖励目标,扩展并推广了这些结果。然后通过一种新颖的归约将这些占用测度连接到单一策略,得到一个混合整数线性规划,其解给出最优策略。我们的公式也可扩展以包含关于次要奖励函数的附加约束。我们在不确定性和性能目标下复杂任务的机器人运动规划背景下说明了我们方法的有效性。
引用
@article{arxiv.2011.00632,
title = {Synthesis of Discounted-Reward Optimal Policies for Markov Decision Processes Under Linear Temporal Logic Specifications},
author = {Krishna C. Kalagarla and Rahul Jain and Pierluigi Nuzzo},
journal= {arXiv preprint arXiv:2011.00632},
year = {2021}
}
备注
Accepted for ACC 2021