中文

基于粗路径理论的连续时间强化学习策略迁移

机器学习 2026-03-04 v3 最优化与控制

摘要

本文研究了策略迁移——这是一种在大型语言模型中采用的著名迁移学习技术——针对连续时间强化学习问题。在连续时间线性-二次系统并引入香浓熵正则化的情形下,我们充分利用其最优策略的高斯结构以及其关联Riccati方程的稳定性。在一般情况下,当系统具有可能的非线性且有界动力学时,关键技术组件是扩散SDE的稳定性,通过引用粗路径理论来建立。我们的工作为连续时间RL提供了首个策略迁移的理论证明:针对一个RL问题学习得的最优策略,可用于初始化以搜索另一个紧密相关RL问题的近最优策略,同时以相同甚至更好的收敛速率实现。作为我们的分析的副产品,我们通过其与LQR的关联,推导出具体一类连续时间基于得分的扩散模型的稳定性。为说明策略迁移在RL中的优势,我们提出了一种新颖的连续时间LQR策略学习算法,该算法实现全局线性收敛和局部超线性收敛。

关键词

引用

@article{arxiv.2510.15165,
  title  = {Policy Transfer for Continuous-Time Reinforcement Learning: A (Rough) Differential Equation Approach},
  author = {Xin Guo and Zijiu Lyu},
  journal= {arXiv preprint arXiv:2510.15165},
  year   = {2026}
}