中文

基于核的 Q 学习的样本复杂度

机器学习 2023-02-03 v1 人工智能 机器学习

摘要

现代强化学习(RL)常面临巨大的状态-动作空间。现有分析结果通常针对状态-动作数量较少的设定,或具有线性建模 Q 函数等简单模型。为推导能处理大状态-动作空间且具更一般 Q 函数的统计高效 RL 策略,近期一些工作考虑了使用核岭回归的非线性函数逼近。本工作中,我们推导了在存在生成模型时基于核的 Q 学习的样本复杂度。我们提出一种非参数 Q 学习算法,可在任意大规模折扣 MDP 中找到 ϵ\epsilon-最优策略。所提算法的样本复杂度关于 ϵ\epsilon 与核的复杂度(以其信息增益衡量)是最优阶的。据我们所知,这是在如此一般模型下给出有限样本复杂度的首个结果。

关键词

引用

@article{arxiv.2302.00727,
  title  = {Sample Complexity of Kernel-Based Q-Learning},
  author = {Sing-Yuan Yeh and Fu-Chieh Chang and Chang-Wei Yueh and Pei-Yuan Wu and Alberto Bernacchia and Sattar Vakili},
  journal= {arXiv preprint arXiv:2302.00727},
  year   = {2023}
}