单次试验中学习到达、游动、行走与飞行:基于稀缺数据与侧面信息的数据驱动控制
系统与控制
2021-12-30 v4 机器学习
机器人学
系统与控制
最优化与控制
摘要
我们针对未知动力系统在极严数据限制下开发了一种基于学习的控制算法。具体而言,该算法仅能访问来自单次正在进行试验的流式含噪数据。它通过有效利用关于动力学的多种侧面信息来降低样本复杂度,从而实现此类性能。此类侧面信息通常源自基础物理定律与系统的定性性质。更确切地说,该算法近似求解一个编码系统期望行为的最优控制问题。为此,它构建并迭代细化一个数据驱动的微分包含,其中含有未知的动力学向量场。该微分包含用于基于区间泰勒的方法中,能够过近似系统可能到达的状态集合。理论上,我们建立了近似解相对于已知动力学最优控制的次优性界。我们表明试验越长或可用侧面信息越多,该界越紧。在经验上,高保真F-16飞机模拟器与MuJoCo环境中的实验表明,尽管数据稀缺,该算法仍可提供与经数百万次环境交互训练的强化学习算法相媲美的性能。此外,我们展示了该算法优于现有结合系统辨识与模型预测控制的技术。
引用
@article{arxiv.2106.10533,
title = {Learning to Reach, Swim, Walk and Fly in One Trial: Data-Driven Control with Scarce Data and Side Information},
author = {Franck Djeumou and Ufuk Topcu},
journal= {arXiv preprint arXiv:2106.10533},
year = {2021}
}
备注
Initial submission to L4DC