NeMo:面向解构DNN模型的神经元级模块化训练方法
机器学习
2025-08-18 v1 人工智能
摘要
随着深度神经网络(DNN)模型在现代软件系统中的广泛应用,构建成本的提高已成为重大挑战。模型重用已被广泛应用于降低训练成本,但不当地整个模型重用可能导致显著的推理开销。因此,DNN模块化受到关注,通过解构DNN模型实现模块重用。新兴的训练时模块化(modularizing-while-training, MwT)范式将模块化融入训练,优于训练后模块化方法。然而,现有MwT方法侧重于小规模CNN模型在卷积核级别,难以处理多样化的DNN和大规模模型,尤其是基于Transformer的模型。为此,我们提出NeMo,一种可扩展且通用的MwT方法。NeMo operates at the neuron level——一种所有DNN通用的基本组件——确保其适用于Transformer和各种体系结构。我们设计了基于对比学习的模块化训练方法,并采用有效的复合损失函数,实现对大规模模型的可扩展性。在两个基于Transformer的模型和四个CNN模型上进行的全面实验表明,NeMo在最先进的MwT方法中具有优势。结果显示,在模块分类准确率上平均提升1.72%,模块大小降低58.10%,在CNN和大规模基于Transformer的模型中均显示出色效。对开源项目的案例研究表明,NeMo在实际场景中潜在的益处,为可扩展且通用的DNN模块化提供了前景方法。
关键词
引用
@article{arxiv.2508.11348,
title = {NeMo: A Neuron-Level Modularizing-While-Training Approach for Decomposing DNN Models},
author = {Xiaohan Bi and Binhang Qi and Hailong Sun and Xiang Gao and Yue Yu and Xiaojun Liang},
journal= {arXiv preprint arXiv:2508.11348},
year = {2025}
}