中文

学习后继状态与目标依赖值函数:一种数学视角

机器学习 2021-01-19 v1

摘要

在强化学习中,基于时序差分的算法可能样本效率低下:例如,在稀疏奖励下,在观测到奖励之前不会发生学习。这可通过学习更丰富的对象来补救,例如环境模型或后继状态。后继状态对给定策略下从任意给定状态出发的期望未来状态占用进行建模,并与目标依赖值函数相关,后者学习如何到达任意状态。我们形式化推导了离散或带函数逼近的连续环境中后继状态和目标依赖值函数学习的时序差分算法。特别地,我们提供了即使在连续环境中也具有有限方差的估计量,其中精确到达目标状态的奖励变得无限稀疏。后继状态满足的不仅仅是Bellman方程:一个反向Bellman算子和一个Bellman-Newton(BN)算子对环境中的路径组合性进行编码。BN算子类似于二阶梯度下降方法,并在获取更多观测时提供值函数的真实更新,带有显式的表格界。在表格情形且学习率无穷小下,混合通常和反向Bellman算子可证明改善渐近收敛的特征值,且BN算子的渐近收敛性可证明优于TD,其速率与环境无关。然而,BN方法更复杂且对采样噪声较不鲁棒。最后,后继状态的一种前向-反向(FB)有限秩参数化享有降方差和改进可采样性,提供值函数的直接模型,具有对应于长程依赖的完全理解的固定点,近似BN方法,并作为副产品提供两种规范状态表示。

关键词

引用

@article{arxiv.2101.07123,
  title  = {Learning Successor States and Goal-Dependent Values: A Mathematical Viewpoint},
  author = {Léonard Blier and Corentin Tallec and Yann Ollivier},
  journal= {arXiv preprint arXiv:2101.07123},
  year   = {2021}
}