利用对数映射在强化学习中启用更低折扣因子
机器学习
2019-12-24 v2 机器学习
摘要
为了更好地理解折扣因子影响强化学习中优化过程的不同方式,我们设计了一组实验来孤立地研究每种影响。我们的分析表明,低折扣因子性能不佳是由(过)小动作间隙引起的这一普遍看法需要修正。我们提出了一个替代假设,将状态空间中动作间隙的大小差异确定为主要原因。然后我们引入一种新方法,通过将价值估计映射到对数空间来实现更均匀的动作间隙。我们在标准假设下证明了该方法的收敛性,并凭经验证明它确实为近似强化学习方法启用了更低的折扣因子。这反过来使得解决一类用传统方法难以解决的强化学习问题成为可能。
引用
@article{arxiv.1906.00572,
title = {Using a Logarithmic Mapping to Enable Lower Discount Factors in Reinforcement Learning},
author = {Harm van Seijen and Mehdi Fatemi and Arash Tavakoli},
journal= {arXiv preprint arXiv:1906.00572},
year = {2019}
}
备注
NeurIPS 2019, code: https://github.com/microsoft/logrl