中文

非马尔可夫奖励模型的在线学习

人工智能 2020-10-01 v2

摘要

在某些情况下,智能体应仅在完成一系列先前任务后才获得奖励,即奖励是非马尔可夫的。表示历史依赖奖励的一种自然且相当通用的方式是通过 Mealy 机,一种从输入序列产生输出序列的有限状态自动机。在我们的形式化设定中,我们考虑一个马尔可夫决策过程(MDP)来建模智能体所处环境的动态,以及一个与该 MDP 同步的 Mealy 机来形式化非马尔可夫奖励函数。虽然 MDP 为智能体所知,但奖励函数对智能体未知且必须被学习。我们克服这一挑战的方法是使用 Angluin 的 LL^* 主动学习算法来学习表示底层非马尔可夫奖励机(MRM)的 Mealy 机。形式化方法用于确定回答 LL^* 提出的所谓成员查询的最优策略。此外,我们证明,只要领域专家提供给定的合理值,所实现的期望奖励最终将至少达到该值。我们在三个问题上评估了我们的框架。结果表明,在非马尔可夫奖励决策过程中使用 LL^* 学习 MRM 是有效的。

关键词

引用

@article{arxiv.2009.12600,
  title  = {Online Learning of Non-Markovian Reward Models},
  author = {Gavin Rens and Jean-François Raskin and Raphaël Reynouad and Giuseppe Marra},
  journal= {arXiv preprint arXiv:2009.12600},
  year   = {2020}
}

备注

24 pages, single column, 7 figures. arXiv admin note: substantial text overlap with arXiv:2001.09293