中文

Mungojerrie:线性时间目标的强化学习

机器学习 2021-06-21 v2 计算机科学中的逻辑 系统与控制 系统与控制

摘要

强化学习在无系统先验知识的情况下合成控制器。在每个时间步给予一个奖励。控制器优化这些奖励的折扣和。应用这类算法需要设计奖励方案,这通常手动完成。设计者必须确保其意图被准确捕捉。这可能并不简单,且容易出错。相对于这种手动编程(类似于直接用汇编编程),另一种方式是以形式化语言指定目标并将其“编译”为奖励方案。Mungojerrie (https://plv.colorado.edu/mungojerrie/) 是一个用于在有限模型上测试 ω\omega-正则目标的奖励方案的工具。该工具包含强化学习算法和概率模型检测器。Mungojerrie支持PRISM中指定的模型和HOA中指定的 ω\omega-自动机。

关键词

引用

@article{arxiv.2106.09161,
  title  = {Mungojerrie: Reinforcement Learning of Linear-Time Objectives},
  author = {Ernst Moritz Hahn and Mateo Perez and Sven Schewe and Fabio Somenzi and Ashutosh Trivedi and Dominik Wojtczak},
  journal= {arXiv preprint arXiv:2106.09161},
  year   = {2021}
}

备注

Mungojerrie is available at https://plv.colorado.edu/mungojerrie/