中文

在线强化学习的样本复杂度:一种多模型视角

机器学习 2026-03-02 v3 系统与控制 系统与控制 最优化与控制 机器学习

摘要

我们在具有连续状态与动作空间的非线性动力系统的一般\hzyrev{非回合式}设定下,研究在线强化学习的样本复杂度。我们的分析涵盖一大类动力系统:从有限个非线性候选模型的集合,到具有有界且 Lipschitz 连续动力学的模型,再到由紧致实值参数集参数化的系统。在最一般的设定下,我们的算法达到了 O(Nϵ2+duln(m(ϵ))/ϵ2)\mathcal{O}(N \epsilon^2 + d_\mathrm{u}\ln(m(\epsilon))/\epsilon^2) 的策略遗憾(policy regret),其中 NN 是时间范围,ϵ\epsilon 是用户指定的离散化宽度,dud_\mathrm{u} 是输入维度,m(ϵ)m(\epsilon) 通过其填充数(packing number)刻画所考虑函数类的复杂度。在动力系统由紧致实值参数集(例如神经网络、Transformer 等)参数化的特殊情形下,我们证明了 O(duNp)\mathcal{O}(\sqrt{d_\mathrm{u}N p}) 的策略遗憾,其中 pp 表示参数个数,从而恢复了先前针对线性时不变动力系统所得到的样本复杂度结果。尽管本文着重刻画样本复杂度,所提出的算法由于其简洁性、能够融合先验知识以及良好的瞬态行为,在实践中很可能具有实用价值。

关键词

引用

@article{arxiv.2501.15910,
  title  = {The Sample Complexity of Online Reinforcement Learning: A Multi-model Perspective},
  author = {Michael Muehlebach and Zhiyu He and Michael I. Jordan},
  journal= {arXiv preprint arXiv:2501.15910},
  year   = {2026}
}

备注

accepted at ICLR 2026; 37 pages, 6 figures