在线强化学习的样本复杂度:一种多模型视角
机器学习
2026-03-02 v3 系统与控制
系统与控制
最优化与控制
机器学习
摘要
我们在具有连续状态与动作空间的非线性动力系统的一般\hzyrev{非回合式}设定下,研究在线强化学习的样本复杂度。我们的分析涵盖一大类动力系统:从有限个非线性候选模型的集合,到具有有界且 Lipschitz 连续动力学的模型,再到由紧致实值参数集参数化的系统。在最一般的设定下,我们的算法达到了 的策略遗憾(policy regret),其中 是时间范围, 是用户指定的离散化宽度, 是输入维度, 通过其填充数(packing number)刻画所考虑函数类的复杂度。在动力系统由紧致实值参数集(例如神经网络、Transformer 等)参数化的特殊情形下,我们证明了 的策略遗憾,其中 表示参数个数,从而恢复了先前针对线性时不变动力系统所得到的样本复杂度结果。尽管本文着重刻画样本复杂度,所提出的算法由于其简洁性、能够融合先验知识以及良好的瞬态行为,在实践中很可能具有实用价值。
引用
@article{arxiv.2501.15910,
title = {The Sample Complexity of Online Reinforcement Learning: A Multi-model Perspective},
author = {Michael Muehlebach and Zhiyu He and Michael I. Jordan},
journal= {arXiv preprint arXiv:2501.15910},
year = {2026}
}
备注
accepted at ICLR 2026; 37 pages, 6 figures