PAD-Net:面向动态网络的高效框架
机器学习
2023-06-01 v4
摘要
动态网络,例如动态卷积和混合专家,已被广泛探索,因为它们能以可接受的计算成本大幅提升模型的表示能力。实现动态网络的常见做法是将给定的静态层转换为全动态层,其中所有参数都是动态的(至少在单层内)并随输入而变化。然而,这种全动态设置可能导致参数冗余和高部署成本,限制了动态网络在更广泛任务和模型中的适用性。我们工作的主要贡献在于挑战动态网络中的基本常识,并提出一种部分动态网络,即PAD-Net,将冗余的动态参数转换为静态参数。此外,我们进一步设计了迭代模式划分,以高效地划分动态和静态参数。我们的方法得到了大规模实验的全面支持,这些实验在图像分类和GLUE基准上采用了两种典型的先进动态架构,即DY-Conv和MoE。令人鼓舞的是,对于ResNet-50,我们仅用30%的动态参数就超越了全动态网络,top-1准确率提高了 ;对于BERT,我们仅用50%的动态参数在语言理解上就获得了 的平均分。代码将在 \url{https://github.com/Shwai-He/PAD-Net} 发布。
引用
@article{arxiv.2211.05528,
title = {PAD-Net: An Efficient Framework for Dynamic Networks},
author = {Shwai He and Liang Ding and Daize Dong and Boan Liu and Fuqiang Yu and Dacheng Tao},
journal= {arXiv preprint arXiv:2211.05528},
year = {2023}
}
备注
Proceedings of ACL 2023