中文

基于控制器网络 dropout 的时序逻辑任务学习型策略优化扩张

系统与控制 2024-08-29 v2 人工智能 机器学习 机器人学 系统与控制

摘要

本文提出一种基于模型的方法,用于训练自动化代理人在高度非线性(尽管是确定性)环境中工作的反馈控制器。我们希望训练好的策略确保该代理人满足具体的任务目标和安全约束,这些目标和约束均以离散时间信号时序逻辑(DT-STL)表示。通过形式化框架(如 DT-STL)重构任务的一个优势是允许定量满足语义。也就是说,给定一个轨迹和一个 DT-STL 公式,我们可以计算该轨迹与满足该公式的轨迹集合之间的近似有符号距离。我们采用反馈控制,并假设使用全连接神经网络来学习反馈控制器。我们展示了这一学习问题类似于训练循环神经网络(RNN),其中循环单元的数量与代理人任务目标的时间视野成正比。这提出了一个挑战:RNN 容易受到梯度消失和梯度爆炸的影响,基于梯度下降的简单求解策略因此会遭受相同问题。为应对这一挑战,我们引入一种基于 dropout 或梯度采样思想的新型梯度近似算法。一个主要贡献是“控制器网络 dropout”的概念,即通过先前训练步骤中使用的控制器获得的控制输入来近似 RNN 在任务时域中的多个时间步骤。我们展示,我们的控制合成方法可以帮助随机梯度下降以更少的数值问题收敛,从而实现对长时间范围和高维状态空间轨迹的可扩展反向传播。

关键词

引用

@article{arxiv.2403.15826,
  title  = {Scaling Learning based Policy Optimization for Temporal Logic Tasks by Controller Network Dropout},
  author = {Navid Hashemi and Bardh Hoxha and Danil Prokhorov and Georgios Fainekos and Jyotirmoy Deshmukh},
  journal= {arXiv preprint arXiv:2403.15826},
  year   = {2024}
}