中文

基于光滑核函数的改进模型基强化学习

机器学习 2026-05-11 v1 机器学习

摘要

在连续状态-动作空间情景下,经典强化学习(RL)理论主要关注低秩马尔可夫决策过程(MDP),它们在结构假设限制方面提供了样本高效的保证。而核平滑模型基方法则提供了另一种可行的范式,利用MDP的光滑性并采用非参数核平滑过渡动态估计。本文提出了一种新的核平滑模型基方法,用于在MDP满足 Lipschitz 连续性假设下的在线强化学习中。通过将贝克曼式探索奖励纳入核平滑框架,我们的方法在时域依赖上超越了当前最先进的 regret 上界。理论推进依赖于贝克曼式奖励与核平滑协同作用的精细分析,其中一种新的紧致贝克曼型浓度不等式对于鞅 may 对独立兴趣。

关键词

引用

@article{arxiv.2605.07218,
  title  = {Improved Model-based Reinforcement Learning with Smooth Kernels},
  author = {Kun Long and Yuqiang Li and Xianyi Wu},
  journal= {arXiv preprint arXiv:2605.07218},
  year   = {2026}
}

备注

38 pages, 5 figures