关于强化学习中 Blackwell 最优策略可现实化的问题
机器学习
2019-05-22 v1 人工智能
机器学习
摘要
N-折扣最优性被引入作为一种策略与值函数最优性的层次化形式,其中 Blackwell 最优性位于该层次结构的顶层(Veinott 1969;Blackwell 1962)。我们基于 MDP 中的 Blackwell 最优性形式化了短视折扣因子、值函数与策略的概念,并提出了一种称为 Blackwell 遗憾的新颖遗憾概念,用以衡量相对于 Blackwell 最优策略的遗憾。我们的主要分析聚焦于具有稀疏奖励的长视野 MDP。我们表明,选择能够实现零 Blackwell 遗憾的折扣因子变得任意困难。此外,即便拥有可实现无 Blackwell 遗憾值函数的此类折扣因子的预言知识,一个 -Blackwell 最优值函数甚至可能不满足增益最优性。我们讨论了与此类问题相关的困难,并定义了策略间隙这一概念,即给定策略与在该状态下不同的任何其他策略之间期望回报的差值;我们证明了与该间隙相关的若干性质。最后,我们给出了进一步支持我们理论结果的实验。
引用
@article{arxiv.1905.08293,
title = {Issues concerning realizability of Blackwell optimal policies in reinforcement learning},
author = {Nicholas Denis},
journal= {arXiv preprint arXiv:1905.08293},
year = {2019}
}
备注
12 pages