一般折扣与平均奖励
机器学习
2007-05-23 v1
摘要
考虑一个在循环中与环境交互的智能体。在每个交互循环中,智能体会因其表现获得奖励。我们将从循环 1 到 m 的平均奖励 U(平均值)与从循环 k 到无穷大的未来折扣奖励 V(折扣值)进行比较。我们考虑本质上任意的(非几何)折扣序列和任意奖励序列(非 MDP 环境)。我们证明,当 m->infinity 时的 U 与当 k->infinity 时的 V 在两者的极限存在的前提下相等。进一步地,如果有效时域随 k 线性增长或更快,则 U 的极限存在性意味着 V 的极限也存在。相反地,如果有效时域随 k 线性增长或更慢,则 V 的极限存在性意味着 U 的极限也存在。
引用
@article{arxiv.cs/0605040,
title = {General Discounting versus Average Reward},
author = {Marcus Hutter},
journal= {arXiv preprint arXiv:cs/0605040},
year = {2007}
}
备注
17 pages, 1 table