折扣因子的泰勒展开
机器学习
2021-06-16 v2
摘要
在实际强化学习(RL)中,用于估计价值函数的折扣因子通常与用于定义评估目标的折扣因子不同。在本工作中,我们研究了这种折扣因子差异在学习过程中的影响,并发现了一族插值两个不同折扣因子价值函数的目标。我们的分析提出了估计价值函数和执行策略优化更新的新方法,并展示了经验性能增益。该框架还对深度 RL 中常用的策略优化算法启发式修改提供了新的见解。
引用
@article{arxiv.2106.06170,
title = {Taylor Expansion of Discount Factors},
author = {Yunhao Tang and Mark Rowland and Rémi Munos and Michal Valko},
journal= {arXiv preprint arXiv:2106.06170},
year = {2021}
}
备注
Accepted at International Conference of Machine Learning (ICML), 2021