近端强化学习:原始 - 对偶空间中序列决策的新理论
机器学习
2014-05-28 v1
摘要
在本文中,我们提出了一种由我们在过去几年中发展的强化学习新愿景,该愿景为长期存在且尚未解决的重要问题提供了数学上严谨的解决方案:(i) 如何设计可靠、收敛且鲁棒的强化学习算法;(ii) 如何保证强化学习满足预先指定的“安全”保障,并保持在参数空间的稳定区域内;(iii) 如何以可靠和稳定的方式设计“离策略”(off-policy) 时序差分学习算法;以及最后 (iv) 如何将强化学习的研究融入随机优化的丰富理论中。在本文中,我们利用近端算子(proximal operators) 的强大框架,对所有这些问题提供了详细的解答。涌现出的核心思想是利用通过 Legendre 变换连接的原始 - 对偶空间。这使得时序差分更新能够在对偶空间中进行,从而带来多种重要的技术优势。Legendre 变换优雅地推广了过去用于解决强化学习问题的算法,例如自然梯度方法,我们证明了这些方法与之前未关联的镜像下降(mirror descent) 方法框架密切相关。同样重要的是,近端算子理论使得算子分裂方法的系统开发成为可能,展示了如何安全可靠地分解基于梯度的时序差分学习最新变体中出现的复杂梯度乘积。这一关键技术革新使得最终为强化学习设计“真正的”随机梯度方法成为可能。最后,Legendre 变换带来了多种其他优势,包括建模稀疏性和域几何。我们的工作广泛建立在关于鞍点算法收敛性和单调算子理论的近期工作基础之上。
引用
@article{arxiv.1405.6757,
title = {Proximal Reinforcement Learning: A New Theory of Sequential Decision Making in Primal-Dual Spaces},
author = {Sridhar Mahadevan and Bo Liu and Philip Thomas and Will Dabney and Steve Giguere and Nicholas Jacek and Ian Gemp and Ji Liu},
journal= {arXiv preprint arXiv:1405.6757},
year = {2014}
}
备注
121 pages