中文

面向Omega-正则目标的强化学习奖励塑造

计算机科学中的逻辑 2020-01-17 v1 机器学习

摘要

近来,已有成功方法利用good-for-MDPs自动机(具有受限非确定性的Büchi自动机)进行无模型强化学习,该类自动机包含了good for games自动机以及最广泛的极限确定性自动机类。使用这些Büchi自动机的基础在于,对于good-for-MDP自动机,Büchi条件可转化为可达性。这种转化的缺陷是奖励平均而言被很晚获得,这需要学习过程中很长的回合。我们设计了一种克服此问题的新奖励塑造方法。我们表明所得模型等价于一个带偏置折扣的折扣收益目标,简化并改进了此前该方向的工作。

关键词

引用

@article{arxiv.2001.05977,
  title  = {Reward Shaping for Reinforcement Learning with Omega-Regular Objectives},
  author = {E. M. Hahn and M. Perez and S. Schewe and F. Somenzi and A. Trivedi and D. Wojtczak},
  journal= {arXiv preprint arXiv:2001.05977},
  year   = {2020}
}