中文

离线监督学习对比在线直接策略优化:神经网络最优反馈控制的比较研究与统一训练范式

最优化与控制 2024-04-10 v3 人工智能

摘要

本工作关注于高效求解基于神经网络的最优控制问题反馈控制器。我们首先对两种主流方法进行比较研究:离线监督学习与在线直接策略优化。尽管监督学习方法的训练部分相对容易,但该方法的成功严重依赖于由开环最优控制求解器生成的最优控制数据集。相比之下,直接策略优化无需任何预计算即可将最优控制问题直接转化为优化问题,但当问题复杂时,与动力学相关的目标可能难以优化。我们的结果凸显了离线监督学习在最优性与训练时间两方面的优越性。为分别克服两种方法中的主要挑战——数据集与优化,我们将二者互补并提出预训练与微调策略作为最优反馈控制的统一训练范式,进一步显著提升了性能与鲁棒性。我们的代码可在 https://github.com/yzhao98/DeepOptimalControl 获取。

关键词

引用

@article{arxiv.2211.15930,
  title  = {Offline Supervised Learning V.S. Online Direct Policy Optimization: A Comparative Study and A Unified Training Paradigm for Neural Network-Based Optimal Feedback Control},
  author = {Yue Zhao and Jiequn Han},
  journal= {arXiv preprint arXiv:2211.15930},
  year   = {2024}
}

备注

Accepted for publication in Physica D