中文

卷积神经网络的鲁棒混合专家训练

计算机视觉与模式识别 2023-08-22 v1 人工智能 机器学习

摘要

稀疏门控混合专家(MoE)作为一种新兴深度模型架构,已展现出实现高精度与超高效率模型推理的巨大潜力。尽管MoE日益流行,鲜有工作探究其在推进卷积神经网络(CNNs)方面的潜力,尤其在对抗鲁棒性层面。由于鲁棒性不足已成为CNNs的主要障碍之一,本文追问:如何对基于CNN的MoE模型进行对抗鲁棒化?我们能否像普通CNN模型一样对其鲁棒训练?我们的初步研究表明,为原始CNN开发的常规对抗训练(AT)机制不再能有效鲁棒化MoE-CNN。为更好理解该现象,我们将MoE-CNN的鲁棒性解构为两个维度:路由器的鲁棒性(即选择数据特定专家的门控函数)与专家的鲁棒性(即由骨干CNN子网络定义的路由器引导路径)。分析表明,在原始AT中路由器与专家难以相互适应。因此,我们提出一种用于MoE的路由器-专家交替对抗训练新框架,称为AdvMoE。我们在4个常用CNN模型架构与4个基准数据集上验证了该方法的有效性。我们发现AdvMoE相较原始稠密CNN取得1%~4%的对抗鲁棒性提升,并享有稀疏门控MoE的效率优势,带来超过50%的推理成本削减。代码见 https://github.com/OPTML-Group/Robust-MoE-CNN。

关键词

引用

@article{arxiv.2308.10110,
  title  = {Robust Mixture-of-Expert Training for Convolutional Neural Networks},
  author = {Yihua Zhang and Ruisi Cai and Tianlong Chen and Guanhua Zhang and Huan Zhang and Pin-Yu Chen and Shiyu Chang and Zhangyang Wang and Sijia Liu},
  journal= {arXiv preprint arXiv:2308.10110},
  year   = {2023}
}

备注

ICCV 2023