中文

正则决策过程的学习与求解

人工智能 2020-03-03 v1

摘要

正则决策过程(RDP)是最近引入的一种模型,它将 MDP 扩展为具有非马尔可夫动力学与奖励。非马尔可夫行为被限制为依赖于历史的正则性质。这些可使用正则表达式或线性动态逻辑(基于有限迹)公式来指定。完全指定的 RDP 可通过将其编译为适当的 MDP 来求解。从数据学习 RDP 是一个尚未解决的挑战性问题,本文聚焦于该问题。我们的方法依赖于一种使用 Mealy 机的新表示,该机为每个状态-动作对发出一个分布与期望奖励。基于此表示,我们将自动机学习技术与历史聚类相结合来学习此类 Mealy 机,并通过将 MCTS 适配于它来进行求解。我们从经验上评估了该方法,证明了其可行性。

关键词

引用

@article{arxiv.2003.01008,
  title  = {Learning and Solving Regular Decision Processes},
  author = {Eden Abadi and Ronen I. Brafman},
  journal= {arXiv preprint arXiv:2003.01008},
  year   = {2020}
}

备注

7 pages, 1 figure