连续时间强化学习: ellipticity 使模型无价值函数逼近成为可能
机器学习
2026-04-17 v2 最优化与控制
统计理论
机器学习
统计理论
摘要
我们研究针对连续时间马尔可夫扩散过程进行的离线策略强化学习,这些过程具有离散时间的观察和动作。我们考虑不依赖动力学不现实结构假设的模型无函数逼近算法,直接从数据中学习价值函数和优势函数。利用扩散过程的 ellipticity,我们建立了一类关于 Bellman 算子的数值 Hilbert 空间正定性和有界性性质。基于这些性质,我们提出了 Sobolev-Prox 贪食 -学习算法,通过迭代求解最小二乘回归问题来学习价值和优势函数。我们推导了估计误差的 oracle 不等式,误差由四个因素决定:(i) 函数类的最佳逼近误差,(ii) 其局部复杂度,(iii) 指数衰减的优化误差,以及 (iv) 数值离散化误差。这些结果识别出 ellipticity 作为马尔可夫扩散进行函数逼近强化学习的关键结构属性,使其难度不大于监督学习。
引用
@article{arxiv.2602.06930,
title = {Continuous-time reinforcement learning: ellipticity enables model-free value function approximation},
author = {Wenlong Mou},
journal= {arXiv preprint arXiv:2602.06930},
year = {2026}
}
备注
update from previous version: removed unnecessarily strong requirement on discount rate