通过演员-评论家学习在层次控制策略中协调规划与跟踪
系统与控制
2024-12-18 v2 机器学习
系统与控制
摘要
我们提出了一种基于强化学习(RL)的算法,用于联合训练(1)轨迹规划器和(2)跟踪控制器,以构建分层控制架构。我们的算法源自对 underlying optimal control problem 的重写,这为 actor-critic 学习方法所需。通过显式学习一个 \textit{dual} 网络来协调规划和跟踪层之间的交互,我们展示了能够在两个组件之间实现有效共识,从而导致可解释的策略。我们在线性二次调节器(LQR)设置下理论证明了该算法收敛到最优 dual 网络,并通过在无穷小车模型上的仿真实验经验验证了其对非线性系统的适用性。
引用
@article{arxiv.2408.01639,
title = {Coordinating Planning and Tracking in Layered Control Policies via Actor-Critic Learning},
author = {Fengjun Yang and Nikolai Matni},
journal= {arXiv preprint arXiv:2408.01639},
year = {2024}
}