Cocktail:通过自适应混合与鲁棒蒸馏从多专家学习更优的神经网络控制器
系统与控制
2021-03-10 v1 系统与控制
摘要
神经网络正日益应用于学习型信息物理系统(LE-CPS)的控制与决策。其在无需构建复杂物理模型的情况下展现出良好性能;然而,对其安全性、鲁棒性与效率的担忧显著阻碍了它们的采用。本工作中,我们提出 COCKTAIL,一种新颖的设计框架,可自动从多个现有控制方法(专家)中学习基于神经网络的控制器,这些专家可以是基于模型的或基于神经网络的。具体而言,COCKTAIL 首先执行强化学习以学习最优的系统级自适应混合策略,该策略以动态分配权重融合各底层专家,随后通过带概率对抗训练与正则化的教师-学生蒸馏,合成具有更高控制鲁棒性(由针对对抗攻击或测量噪声的安全控制率度量)、控制能效与可验证性(由验证计算时间度量)的学生神经网络控制器。在三个非线性系统上的实验表明,相较多种基线方法,我们的方法在这些性质上具有显著优势。
引用
@article{arxiv.2103.05046,
title = {Cocktail: Learn a Better Neural Network Controller from Multiple Experts via Adaptive Mixing and Robust Distillation},
author = {Yixuan Wang and Chao Huang and Zhilu Wang and Shichao Xu and Zhaoran Wang and Qi Zhu},
journal= {arXiv preprint arXiv:2103.05046},
year = {2021}
}
备注
The paper has been accepted by Design Automation Conference 2021