基于核的 Q 学习的样本复杂度
机器学习
2023-02-03 v1 人工智能
机器学习
摘要
现代强化学习(RL)常面临巨大的状态-动作空间。现有分析结果通常针对状态-动作数量较少的设定,或具有线性建模 Q 函数等简单模型。为推导能处理大状态-动作空间且具更一般 Q 函数的统计高效 RL 策略,近期一些工作考虑了使用核岭回归的非线性函数逼近。本工作中,我们推导了在存在生成模型时基于核的 Q 学习的样本复杂度。我们提出一种非参数 Q 学习算法,可在任意大规模折扣 MDP 中找到 -最优策略。所提算法的样本复杂度关于 与核的复杂度(以其信息增益衡量)是最优阶的。据我们所知,这是在如此一般模型下给出有限样本复杂度的首个结果。
引用
@article{arxiv.2302.00727,
title = {Sample Complexity of Kernel-Based Q-Learning},
author = {Sing-Yuan Yeh and Fu-Chieh Chang and Chang-Wei Yueh and Pei-Yuan Wu and Alberto Bernacchia and Sattar Vakili},
journal= {arXiv preprint arXiv:2302.00727},
year = {2023}
}