中文

Omega-正则奖励机

机器学习 2023-08-16 v1 人工智能 形式语言与自动机理论

摘要

强化学习(RL)是训练智能体执行任务的强大方法,但设计恰当的奖励机制对其成功至关重要。然而,在许多情况下,学习目标复杂性超出马尔可夫假设的能力范围,需要更精巧的奖励机制。奖励机与 omega-正则语言是两种分别用于表达定量与定性目标的非马尔可夫奖励的形式化工具。本文提出 omega-正则奖励机,将奖励机与 omega-正则语言相集成,为 RL 提供具表达力且高效的奖励机制。我们给出一种无模型 RL 算法,以针对 omega-正则奖励机计算 epsilon-最优策略,并通过实验评估所提算法的有效性。

关键词

引用

@article{arxiv.2308.07469,
  title  = {Omega-Regular Reward Machines},
  author = {Ernst Moritz Hahn and Mateo Perez and Sven Schewe and Fabio Somenzi and Ashutosh Trivedi and Dominik Wojtczak},
  journal= {arXiv preprint arXiv:2308.07469},
  year   = {2023}
}

备注

To appear in ECAI-2023