基于粗路径理论的连续时间强化学习策略迁移
机器学习
2026-03-04 v3 最优化与控制
摘要
本文研究了策略迁移——这是一种在大型语言模型中采用的著名迁移学习技术——针对连续时间强化学习问题。在连续时间线性-二次系统并引入香浓熵正则化的情形下,我们充分利用其最优策略的高斯结构以及其关联Riccati方程的稳定性。在一般情况下,当系统具有可能的非线性且有界动力学时,关键技术组件是扩散SDE的稳定性,通过引用粗路径理论来建立。我们的工作为连续时间RL提供了首个策略迁移的理论证明:针对一个RL问题学习得的最优策略,可用于初始化以搜索另一个紧密相关RL问题的近最优策略,同时以相同甚至更好的收敛速率实现。作为我们的分析的副产品,我们通过其与LQR的关联,推导出具体一类连续时间基于得分的扩散模型的稳定性。为说明策略迁移在RL中的优势,我们提出了一种新颖的连续时间LQR策略学习算法,该算法实现全局线性收敛和局部超线性收敛。
引用
@article{arxiv.2510.15165,
title = {Policy Transfer for Continuous-Time Reinforcement Learning: A (Rough) Differential Equation Approach},
author = {Xin Guo and Zijiu Lyu},
journal= {arXiv preprint arXiv:2510.15165},
year = {2026}
}