稳定离策略强化学习的表示
机器学习
2020-10-06 v2 人工智能
机器学习
摘要
带有函数近似的强化学习可能不稳定甚至发散,尤其当与离策略学习和贝尔曼更新结合时。在深度强化学习中,这些问题已通过经验和正则化表示(特别是借助辅助任务)加以应对。这表明表示学习或许能提供保证稳定性的手段。本文正式证明,确实存在非平凡的状态表示,使得规范 TD 算法即使在学习离策略时也是稳定的。我们沿三个维度——近似误差、稳定性与估计难易度——分析了基于策略转移矩阵的表示学习方案,如原型值函数。在最一般情形下,我们证明 Schur 基提供收敛保证,但难以从样本中估计。对于固定奖励函数,我们发现相应 Krylov 子空间的正交基是更佳选择。最后我们通过经验证明,这些稳定表示可利用随机梯度下降学习,从而为深度网络表示学习的改进技术打开大门。
引用
@article{arxiv.2007.05520,
title = {Representations for Stable Off-Policy Reinforcement Learning},
author = {Dibya Ghosh and Marc G. Bellemare},
journal= {arXiv preprint arXiv:2007.05520},
year = {2020}
}
备注
ICML 2020