中文

有限 horizon 下深度强化学习探索最概转移路径

最优化与控制 2023-06-08 v2

摘要

在许多科学与工程问题中,噪声与非线性不可避免,并可能引发诸如转移现象等有趣的数学问题。本文聚焦于利用强化学习高效发现随机动力系统的最概转移路径。借助Onsager-Machlup作用泛函理论量化随机动力系统中的稀有事件,寻找最概路径等价于求解作用泛函上的变分问题。当作用函数无法由参考轨道附近路径显式表达时,该变分问题需转化为最优控制问题。首先,通过将终端预测整合进强化学习框架,我们开发了终端预测深度确定性策略梯度(TP-DDPG)算法,以前向方式处理有限horizon最优控制问题。接着,我们针对值函数给出了算法在神经网络逼近误差与估计误差方面的收敛性分析。最后,我们在不同维度的应用转移问题上进行了多种实验,以阐明我们算法的有效性。

关键词

引用

@article{arxiv.2304.12994,
  title  = {Deep Reinforcement Learning in Finite-Horizon to Explore the Most Probable Transition Pathway},
  author = {Jin Guo and Ting Gao and Peng Zhang and Jiequn Han and Jinqiao Duan},
  journal= {arXiv preprint arXiv:2304.12994},
  year   = {2023}
}

备注

33 pages, 24 figures