中文

论马尔可夫奖励的表达能力

机器学习 2022-01-19 v2 人工智能

摘要

奖励是强化学习智能体的驱动力。本文致力于理解奖励的表达能力,以此作为捕获我们希望智能体执行任务的方式。我们围绕三种可能合意的“任务”新抽象概念展开研究:(1) 一组可接受行为,(2) 行为上的偏序,或 (3) 轨迹上的偏序。我们的主要结果证明,尽管奖励能表达其中许多任务,但每种任务类型都存在任何马尔可夫奖励函数都无法捕获的实例。随后我们提供一组多项式时间算法,构造允许智能体优化这三类任务的马尔可夫奖励函数,并正确判定何时不存在这样的奖励函数。最后我们通过实证研究印证并阐释了理论发现。

关键词

引用

@article{arxiv.2111.00876,
  title  = {On the Expressivity of Markov Reward},
  author = {David Abel and Will Dabney and Anna Harutyunyan and Mark K. Ho and Michael L. Littman and Doina Precup and Satinder Singh},
  journal= {arXiv preprint arXiv:2111.00876},
  year   = {2022}
}

备注

Accepted to NeurIPS 2021