中文

面向通用函数逼近的离线到在线价值适应的可证明效率

机器学习 2026-04-16 v1

摘要

我们研究了在通用函数逼近下进行离线到在线价值适应。从不完美的离线预训练Q函数开始,学习者仅通过有限的在线交互来适应其以适应目标环境。我们首先通过建立Minimax下界来刻画这一设定的难度,表明即使预训练Q函数接近最优Q*,在某些困难实例中,在线适应也不比纯在线RL更高效。在正面结果方面,在离线预训练价值函数上提出一种新颖结构条件,我们提出了O2O-LSVI算法,具有问题相关的样本复杂度,能够在一定程度上超过纯在线RL。最后,我们通过神经网络实验来证明所提出方法的实际有效性。

关键词

引用

@article{arxiv.2604.13966,
  title  = {Provably Efficient Offline-to-Online Value Adaptation with General Function Approximation},
  author = {Shangzhe Li and Weitong Zhang},
  journal= {arXiv preprint arXiv:2604.13966},
  year   = {2026}
}

备注

44 pages, 2 tables