DNA系列:通过分块监督提升权重共享神经架构搜索
计算机视觉与模式识别
2024-03-05 v1
摘要
神经架构搜索(NAS)旨在由机器自动设计神经架构,已被视为迈向自动机器学习的关键一步。其中一个显著的NAS分支是权重共享NAS,它显著提升了搜索效率,使得NAS算法能够在普通计算机上运行。尽管备受期待,这类方法却面临搜索有效性低的问题。通过使用泛化界工具,我们证明了这一缺陷背后的原因是:在可能架构的过大搜索空间中,架构评级不可信。针对此问题,我们将大搜索空间模块化为具有小搜索空间的分块,并利用蒸馏神经架构(DNA)技术开发了一系列模型。这些提出的模型,即DNA系列,能够解决权重共享NAS的多重困境,如可扩展性、效率和多模态兼容性。与以往仅能通过启发式算法访问子搜索空间的工作不同,我们提出的DNA模型能够对所有架构候选进行评级。此外,在一定的计算复杂度约束下,我们的方法可以寻找不同深度和宽度的架构。大量实验评估表明,我们的模型在ImageNet上针对移动卷积网络和小型视觉Transformer分别达到了78.9%和83.6%的最先进top-1准确率。此外,我们提供了对神经架构评级的深入实证分析和见解。代码见:\url{https://github.com/changlin31/DNA}。
引用
@article{arxiv.2403.01326,
title = {DNA Family: Boosting Weight-Sharing NAS with Block-Wise Supervisions},
author = {Guangrun Wang and Changlin Li and Liuchun Yuan and Jiefeng Peng and Xiaoyu Xian and Xiaodan Liang and Xiaojun Chang and Liang Lin},
journal= {arXiv preprint arXiv:2403.01326},
year = {2024}
}
备注
T-PAMI