Optimal-PhiBE:基于偏微分方程的无模型连续时间强化学习框架
最优化与控制
2025-10-14 v2
摘要
本文研究连续时间强化学习(CTRL),其中系统动力学由未知随机微分方程支配,且仅可获得离散时间观测。现有方法存在局限:基于偏微分方程的模型方法面临不可辨识性问题,而基于离散时间最优贝尔曼方程(Optimal-BE)的无模型方法则遭受对系统动力学和奖励结构高度敏感的大离散化误差。为克服这些挑战,本文提出 Optimal-PhiBE,该框架将离散时间信息整合到连续时间偏微分方程中,兼具两种现有框架的优势并缓解其局限性。当无控系统演化缓慢时,Optimal-PhiBE 表现出更小的离散化误差,对振荡型奖励结构的敏感度降低,并实现了无需显式动力学估计的无模型算法。在线性二次调节器(LQR)设定下,对 Optimal-PhiBE 和 Optimal-BE 建立了尖锐的误差界。结果表明,Optimal-PhiBE 在无折扣情况下精确恢复最优策略,在弱折扣或控制主导问题中显著优于 Optimal-BE。此外,本文将 Optimal-PhiBE 扩展至高阶,提供逐步更精确的近似。基于轨迹数据直接求解 Optimal-PhiBE 的无模型策略迭代算法被提出。数值实验用于验证理论结果。
引用
@article{arxiv.2506.05208,
title = {Optimal-PhiBE: A PDE-based Model-free framework for Continuous-time Reinforcement Learning},
author = {Yuhua Zhu and Yuming Zhang and Haoyu Zhang},
journal= {arXiv preprint arXiv:2506.05208},
year = {2025}
}