中文

通过激活驱动训练实现DNN模块化

机器学习 2026-01-15 v4

摘要

深度神经网络(DNN)在适应不断变化的需求时倾向于积累技术债务并遭受显著的重新训练成本。将DNN模块化有望提高其可重用性。先前的研究提出了在训练期间和训练后将DNN模型分解为模块的技术。然而,这些策略存在若干缺点,包括模块之间显著的权重重叠和准确率损失,仅限于卷积层的关注,以及通过引入辅助掩码来控制模块化所带来的额外复杂性和训练时间。在本工作中,我们提出了MODA,一种激活驱动的模块化训练方法。MODA通过直接根据三个模块化目标调节其层的激活输出,在DNN模型中促进固有的模块化:类内亲和性、类间分散性和紧凑性。使用三个知名DNN模型和五个不同大小的数据集对MODA进行了评估。该评估表明,与现有最先进方法相比,使用MODA具有若干优势:(1)MODA以少22%的训练时间实现模块化;(2)MODA生成的模块包含少24倍的权重和少37倍的权重重叠,同时(3)在无需额外细调的情况下保持原始模型的准确率;在模块替换场景中,(4)MODA平均将目标类的准确率提高12%,同时确保对其他类准确率的影响最小。

关键词

引用

@article{arxiv.2411.01074,
  title  = {DNN Modularization via Activation-Driven Training},
  author = {Tuan Ngo and Abid Hassan and Saad Shafiq and Nenad Medvidovic},
  journal= {arXiv preprint arXiv:2411.01074},
  year   = {2026}
}

备注

Accepted at International Conference on Software Engineering (ICSE) 2026 - Research Track