通过低秩矩阵估计实现样本高效的强化学习
机器学习
2020-06-12 v1 机器学习
摘要
我们考虑在生成模型下,以样本高效方式学习连续状态与动作空间强化学习的 函数的问题。若 函数 Lipschitz 连续,则根据经典非参数学习理论,估计 -最优 函数的最小样本复杂度已知为 ,其中 与 分别表示状态与动作空间的维度。当将 函数视为核时,其诱导 Hilbert-Schmidt 算子,从而具有平方可和谱。这促使我们考虑一类由其“秩” 参数化的 函数参数族,当 时其包含所有 Lipschitz 函数。作为关键贡献,我们开发了一种简单迭代学习算法,当最优 函数具有低秩 且折扣因子 低于某阈值时,以 的样本复杂度找到 -最优 函数。因此,这在样本复杂度上提供了指数级改进。为达成该结果,我们开发了一种新颖的矩阵估计算法,即使在任意有界噪声存在下也能以 意义忠实估计未知低秩矩阵,这本身可能具有独立意义。在若干随机控制任务上的实证结果证实了我们的“低秩”算法的有效性。
引用
@article{arxiv.2006.06135,
title = {Sample Efficient Reinforcement Learning via Low-Rank Matrix Estimation},
author = {Devavrat Shah and Dogyoon Song and Zhi Xu and Yuzhe Yang},
journal= {arXiv preprint arXiv:2006.06135},
year = {2020}
}