中文

PAD-Net:面向动态网络的高效框架

机器学习 2023-06-01 v4

摘要

动态网络,例如动态卷积和混合专家,已被广泛探索,因为它们能以可接受的计算成本大幅提升模型的表示能力。实现动态网络的常见做法是将给定的静态层转换为全动态层,其中所有参数都是动态的(至少在单层内)并随输入而变化。然而,这种全动态设置可能导致参数冗余和高部署成本,限制了动态网络在更广泛任务和模型中的适用性。我们工作的主要贡献在于挑战动态网络中的基本常识,并提出一种部分动态网络,即PAD-Net,将冗余的动态参数转换为静态参数。此外,我们进一步设计了迭代模式划分,以高效地划分动态和静态参数。我们的方法得到了大规模实验的全面支持,这些实验在图像分类和GLUE基准上采用了两种典型的先进动态架构,即DY-Conv和MoE。令人鼓舞的是,对于ResNet-50,我们仅用30%的动态参数就超越了全动态网络,top-1准确率提高了 +0.7%+0.7\%;对于BERT,我们仅用50%的动态参数在语言理解上就获得了 +1.9%+1.9\% 的平均分。代码将在 \url{https://github.com/Shwai-He/PAD-Net} 发布。

关键词

引用

@article{arxiv.2211.05528,
  title  = {PAD-Net: An Efficient Framework for Dynamic Networks},
  author = {Shwai He and Liang Ding and Daize Dong and Boan Liu and Fuqiang Yu and Dacheng Tao},
  journal= {arXiv preprint arXiv:2211.05528},
  year   = {2023}
}

备注

Proceedings of ACL 2023