核化 LSTD 的流形正则化
机器学习
2017-10-17 v1 人工智能
机器学习
摘要
策略评估或价值函数或 Q 函数逼近是强化学习 (RL) 中的关键过程。它是策略迭代的必要组成部分,可用于策略梯度方法中的方差缩减。因此,其质量对大多数 RL 算法有显著影响。受流形正则化学习启发,我们提出了一种新颖的核化策略评估方法,该方法利用从数据中学习到的状态空间内蕴几何,以在 Q 函数逼近中实现更好的样本效率和更高的精度。在最小二乘策略迭代 (LSPI) 框架中应用该方法,在两个标准基准上,我们在策略质量方面观察到优于广泛使用的参数化基函数的性能。
引用
@article{arxiv.1710.05387,
title = {Manifold Regularization for Kernelized LSTD},
author = {Xinyan Yan and Krzysztof Choromanski and Byron Boots and Vikas Sindhwani},
journal= {arXiv preprint arXiv:1710.05387},
year = {2017}
}
备注
6 pages, CoRL 2017 non-archival track