模型预测控制与强化学习:基于动态规划的统一框架
系统与控制
2024-07-02 v3 人工智能
系统与控制
最优化与控制
摘要
在本文中,我们描述了一个连接近似动态规划、模型预测控制和强化学习的新概念框架。该框架围绕两个算法展开,这两个算法在很大程度上是相互独立设计的,并通过牛顿法的强大机制协同运作。我们称它们为离线训练算法和在线对弈算法。这些名称借鉴了强化学习在游戏方面的一些重大成功;主要例子是最近的(2017年)AlphaZero程序(下国际象棋,[SHS17],[SSS17]),以及结构相似且更早的(1990年代)TD-Gammon程序(下西洋双陆棋,[Tes94],[Tes95],[TeG96])。在这些游戏背景下,离线训练算法是用于教程序如何评估局面以及在任何给定局面下生成好棋步的方法,而在线对弈算法是用于实时与人类或计算机对手对弈的方法。值得注意的是,离线训练和在线对弈之间的协同作用也是模型预测控制(以及其他主要类别的序贯决策问题)的基础,事实上,模型预测控制的设计架构与AlphaZero和TD-Gammon非常相似。这一概念性见解为弥合强化学习和模型预测控制之间的文化鸿沟提供了途径,并为模型预测控制中的一些基本问题提供了新的视角。这些问题包括通过 rollout 增强稳定性特性、通过使用确定性等价来处理不确定性、模型预测控制在涉及系统参数变化的自适应控制环境中的韧性,以及牛顿法所隐含的超线性性能界所提供的见解。
引用
@article{arxiv.2406.00592,
title = {Model Predictive Control and Reinforcement Learning: A Unified Framework Based on Dynamic Programming},
author = {Dimitri P. Bertsekas},
journal= {arXiv preprint arXiv:2406.00592},
year = {2024}
}