在有限迹上使用 LDL 指定 MDP 中的非马尔可夫奖励(初步版本)
人工智能
2017-06-27 v1
摘要
在马尔可夫决策过程(MDPs)中,在一个状态中获得的奖励取决于上一个状态和动作的属性。这种状态依赖性使得奖励更有趣的长期行为变得困难,例如在门打开后总是将其关闭,或者仅在请求后才提供咖啡。扩展 MDP 以处理此类非马尔可夫奖励函数是先前两条研究路线的主题,两者均使用 LTL 的变体来指定奖励函数,然后将新模型编译回马尔可夫模型。基于有限迹上时序逻辑理论的最新进展,我们采用 LDLf 来指定非马尔可夫奖励,并提供了一种优雅的自动机构造方法来构建马尔可夫模型,该方法扩展了先前的工作,并提供了强极小性和组合性保证。
引用
@article{arxiv.1706.08100,
title = {Specifying Non-Markovian Rewards in MDPs Using LDL on Finite Traces (Preliminary Version)},
author = {Ronen Brafman and Giuseppe De Giacomo and Fabio Patrizi},
journal= {arXiv preprint arXiv:1706.08100},
year = {2017}
}