SortedNet:一种用于训练模块化深度神经网络的可扩展通用框架
机器学习
2024-06-04 v3
摘要
深度神经网络(DNNs)必须满足具有不同性能需求与预算的各类用户,这导致了训练、存储和维护大量用户/任务专用模型的高昂做法。文献中存在以单一动态模型或多合一模型替代多个独立网络的方案;然而,它们存在性能显著下降、缺乏跨不同模型架构或不同维度(如深度、宽度、注意力块)的泛化能力、训练期间繁重的模型搜索需求,以及只能训练有限数量子模型等局限。为应对这些限制,我们提出 SortedNet,一种利用 DNN 固有模块性的通用且可扩展的训练方案。得益于具有共享参数的通用嵌套架构(本文中称之为\textit{sorted}架构)及其结合随机子模型采样与新型梯度累积机制的更新方案,SortedNet 能够在训练主模型的同时训练子模型(无需任何显著的额外训练或推理开销),简化动态模型选择,在推理时定制部署,并显著降低模型存储需求。SortedNet 的通用性与可扩展性通过各种架构与任务得到验证,包括 LLaMA、BERT、RoBERTa(NLP 任务)、ResNet 和 MobileNet(图像分类),展示了其相对于现有动态训练方法的优越性。例如,我们基于 sorted-training 引入一种新颖的自适应自推测方法以加速大语言模型解码。此外,SortedNet 能够一次训练 160 个子模型,达到原始模型至少 96% 的性能。
引用
@article{arxiv.2309.00255,
title = {SortedNet: A Scalable and Generalized Framework for Training Modular Deep Neural Networks},
author = {Mojtaba Valipour and Mehdi Rezagholizadeh and Hossein Rajabzadeh and Parsa Kavehzadeh and Marzieh Tahaei and Boxing Chen and Ali Ghodsi},
journal= {arXiv preprint arXiv:2309.00255},
year = {2024}
}