面向随机最优控制的高效在策略深度学习框架
机器学习
2025-05-14 v3 最优化与控制
摘要
我们提出了一种用于求解随机最优控制 (SOC) 问题的新颖在策略算法。通过利用 Girsanov 定理,我们的方法直接计算 SOC 目标的在策略梯度,无需通过随机微分方程或边值问题进行昂贵的反向传播。该方法显著加速了神经网络控制策略的优化,同时在高维问题和长时间尺度上具有良好的扩展性。我们在经典 SOC 基准问题上进行评估,以及应用于通过 Schrödinger-F"ollmer 过程从未归一化分布进行抽样和微调预训练扩散模型。实验结果表明,与现有方法相比,我们的方法在计算速度和内存效率方面都实现了显著提升。
引用
@article{arxiv.2410.05163,
title = {An Efficient On-Policy Deep Learning Framework for Stochastic Optimal Control},
author = {Mengjian Hua and Mathieu Laurière and Eric Vanden-Eijnden},
journal= {arXiv preprint arXiv:2410.05163},
year = {2025}
}