中文

稳定离策略强化学习的表示

机器学习 2020-10-06 v2 人工智能 机器学习

摘要

带有函数近似的强化学习可能不稳定甚至发散,尤其当与离策略学习和贝尔曼更新结合时。在深度强化学习中,这些问题已通过经验和正则化表示(特别是借助辅助任务)加以应对。这表明表示学习或许能提供保证稳定性的手段。本文正式证明,确实存在非平凡的状态表示,使得规范 TD 算法即使在学习离策略时也是稳定的。我们沿三个维度——近似误差、稳定性与估计难易度——分析了基于策略转移矩阵的表示学习方案,如原型值函数。在最一般情形下,我们证明 Schur 基提供收敛保证,但难以从样本中估计。对于固定奖励函数,我们发现相应 Krylov 子空间的正交基是更佳选择。最后我们通过经验证明,这些稳定表示可利用随机梯度下降学习,从而为深度网络表示学习的改进技术打开大门。

关键词

引用

@article{arxiv.2007.05520,
  title  = {Representations for Stable Off-Policy Reinforcement Learning},
  author = {Dibya Ghosh and Marc G. Bellemare},
  journal= {arXiv preprint arXiv:2007.05520},
  year   = {2020}
}

备注

ICML 2020