面向通用函数逼近的离线到在线价值适应的可证明效率
机器学习
2026-04-16 v1
摘要
我们研究了在通用函数逼近下进行离线到在线价值适应。从不完美的离线预训练Q函数开始,学习者仅通过有限的在线交互来适应其以适应目标环境。我们首先通过建立Minimax下界来刻画这一设定的难度,表明即使预训练Q函数接近最优Q*,在某些困难实例中,在线适应也不比纯在线RL更高效。在正面结果方面,在离线预训练价值函数上提出一种新颖结构条件,我们提出了O2O-LSVI算法,具有问题相关的样本复杂度,能够在一定程度上超过纯在线RL。最后,我们通过神经网络实验来证明所提出方法的实际有效性。
引用
@article{arxiv.2604.13966,
title = {Provably Efficient Offline-to-Online Value Adaptation with General Function Approximation},
author = {Shangzhe Li and Weitong Zhang},
journal= {arXiv preprint arXiv:2604.13966},
year = {2026}
}
备注
44 pages, 2 tables