强化学习策略在再生核希尔伯特空间中的表示
机器学习
2020-10-16 v2 机器学习
摘要
我们提出一个用于强化学习任务策略表示的通用框架。该框架涉及在再生核希尔伯特空间(RKHS)中寻找策略的低维嵌入。基于 RKHS 的方法使我们能够对重构策略的期望回报推导出强有力的理论保证。此类保证在黑盒模型中通常缺失,但在需要稳定性的任务中非常可取。我们在经典 RL 领域上进行了若干实验。结果证实,策略可鲁棒地嵌入低维空间,而嵌入策略几乎不导致回报下降。
引用
@article{arxiv.2002.02863,
title = {Representation of Reinforcement Learning Policies in Reproducing Kernel Hilbert Spaces},
author = {Bogdan Mazoure and Thang Doan and Tianyu Li and Vladimir Makarenkov and Joelle Pineau and Doina Precup and Guillaume Rabusseau},
journal= {arXiv preprint arXiv:2002.02863},
year = {2020}
}