中文

一般折扣与平均奖励

机器学习 2007-05-23 v1

摘要

考虑一个在循环中与环境交互的智能体。在每个交互循环中,智能体会因其表现获得奖励。我们将从循环 1 到 m 的平均奖励 U(平均值)与从循环 k 到无穷大的未来折扣奖励 V(折扣值)进行比较。我们考虑本质上任意的(非几何)折扣序列和任意奖励序列(非 MDP 环境)。我们证明,当 m->infinity 时的 U 与当 k->infinity 时的 V 在两者的极限存在的前提下相等。进一步地,如果有效时域随 k 线性增长或更快,则 U 的极限存在性意味着 V 的极限也存在。相反地,如果有效时域随 k 线性增长或更慢,则 V 的极限存在性意味着 U 的极限也存在。

关键词

引用

@article{arxiv.cs/0605040,
  title  = {General Discounting versus Average Reward},
  author = {Marcus Hutter},
  journal= {arXiv preprint arXiv:cs/0605040},
  year   = {2007}
}

备注

17 pages, 1 table