关于混合专家模型的对抗鲁棒性
机器学习
2022-10-20 v1 人工智能
密码学与安全
计算机视觉与模式识别
摘要
对抗鲁棒性是神经网络的一项关键理想性质。经验表明,它受其规模影响,较大的网络通常更鲁棒。最近,Bubeck 和 Sellke 根据函数的参数量证明了拟合训练数据的函数的 Lipschitz 常数的下界。这引出了一个有趣的开放问题:参数量更多但不一定计算代价更高的函数,是否——以及能否——具有更好的鲁棒性?我们针对稀疏混合专家模型(Mixture of Experts, MoEs)研究该问题,这类模型能够以大致恒定的计算代价扩大模型规模。我们从理论上证明,在路由和数据的结构满足特定条件时,MoE 的 Lipschitz 常数可显著小于其稠密对应模型。当对某输入权重最高的专家所实现的函数差异足够大时,MoE 的鲁棒性会受损。接下来,我们在 ImageNet 上利用对抗攻击对 MoE 的鲁棒性进行经验评估,表明它们确实比具有相同计算代价的稠密模型更鲁棒。我们作出了关键观察,显示 MoE 对专家选择的鲁棒性,突显了实践中所训练模型中专家的冗余性。
引用
@article{arxiv.2210.10253,
title = {On the Adversarial Robustness of Mixture of Experts},
author = {Joan Puigcerver and Rodolphe Jenatton and Carlos Riquelme and Pranjal Awasthi and Srinadh Bhojanapalli},
journal= {arXiv preprint arXiv:2210.10253},
year = {2022}
}
备注
Accepted to NeurIPS 2022