中文

DNAD:可微神经网络架构蒸馏

机器学习 2025-04-30 v1 人工智能

摘要

为满足设计在模型性能(如分类准确率)和计算复杂度之间合适权衡的需求,本文开发了基于两大核心模块的可微神经网络架构蒸馏(DNAD)算法,即删除搜索与模仿搜索。首先,为了在单元同类型不再共享相同拓扑的空间中派生神经网络架构,本文基于可微架构搜索(DARTS)框架开发了基于删除的超网络渐进缩减(SNPS)算法,即删除搜索。与传统DARTS方法不同,后者产生的神经网络结构简单,且仅在搜索过程中派生出一个架构,而SNPS能够通过强制动态超网络从稠密结构逐渐缩减为稀疏结构,派生出具有灵活结构的帕累托最优架构集合。此外,鉴于知识蒸馏(KD)显示在辅助过参数模型训练紧凑网络方面效果显著,本文将SNPS与KD集成,构成DNAD算法,即模仿搜索。通过最小化超网络与教师网络之间的行为差异,避免了单层DARTS的过拟合问题,成功派生出高性能神经网络架构。在CIFAR-10和ImageNet分类任务上的实验表明,SNPS和DNAD均能够派生出一组在错误率上与之相当或更低,同时参数数目和FLOPs更少的架构。特别地,DNAD在ImageNet分类任务中实现了23.7%的Top-1错误率,模型仅为600万参数,5.98亿FLOPs,优于大多数基于DARTS的方法。

关键词

引用

@article{arxiv.2504.20080,
  title  = {DNAD: Differentiable Neural Architecture Distillation},
  author = {Xuan Rao and Bo Zhao and Derong Liu},
  journal= {arXiv preprint arXiv:2504.20080},
  year   = {2025}
}