训练中模块化:一种模块化深度神经网络模型的新范式
机器学习
2023-10-06 v3 人工智能
软件工程
摘要
深度神经网络(DNN)模型已成为智能软件系统中日益关键的组成部分。然而,训练 DNN 模型通常在时间与资金上代价高昂。为解决该问题,研究者近期聚焦于复用现有 DNN 模型——借鉴软件工程中的代码复用思想。然而,复用整个模型可能带来额外开销或继承不期望功能的缺陷。因此,现有工作提出将已训练模型分解为模块,即训练后模块化,并实现模块复用。由于训练好的模型并非为模块化而构建,训练后模块化会带来巨大开销与模型精度损失。本文提出一种将模块化融入模型训练过程的新方法,即训练中模块化(MwT)。我们通过两个分别优化模块内聚性与模块间耦合度的损失函数,将模型训练为结构模块化。我们在本工作中实现了所提方法以对卷积神经网络(CNN)模型进行模块化。在代表性模型上的评估结果表明 MwT 优于最先进方法。具体而言,MwT 引起的精度损失仅 1.13 个百分点,比基线少 1.76 个百分点。MwT 生成的模块核保留率仅 14.58%,比最先进方法降低 74.31%。此外,训练与模块化的总时间成本仅 108 分钟,为基线的一半。
引用
@article{arxiv.2306.09376,
title = {Modularizing while Training: A New Paradigm for Modularizing DNN Models},
author = {Binhang Qi and Hailong Sun and Hongyu Zhang and Ruobing Zhao and Xiang Gao},
journal= {arXiv preprint arXiv:2306.09376},
year = {2023}
}
备注
Accepted at ICSE'24