NAR-Former:面向整体属性预测的神经网络架构表示学习
计算机视觉与模式识别
2023-03-24 v3 人工智能
摘要
随着深度学习模型在真实应用中的广泛且深入的采用,对神经网络自身进行建模与表示学习的需求日益增长。这些模型可用于估计不同神经网络架构的属性(如准确率和延迟),而无需运行实际的训练或推理任务。本文提出一种神经网络架构表示模型,可用于整体地估计这些属性。具体而言,我们首先提出一种简单而有效的分词器,将神经网络的操作与拓扑信息编码为单一序列。然后,我们设计了一个多阶段融合 transformer,从转换后的序列构建紧凑的向量表示。为高效训练模型,我们进一步提出信息流一致性增强,并相应设计了一种架构一致性损失,与以往的随机增强策略相比,该损失以更少的增强样本带来更多收益。在 NAS-Bench-101、NAS-Bench-201、DARTS 搜索空间和 NNLQP 上的实验结果表明,我们提出的框架可用于预测上述单元架构和整个深度神经网络的延迟与准确率属性,并取得了有前景的性能。代码见 https://github.com/yuny220/NAR-Former。
引用
@article{arxiv.2211.08024,
title = {NAR-Former: Neural Architecture Representation Learning towards Holistic Attributes Prediction},
author = {Yun Yi and Haokui Zhang and Wenze Hu and Nannan Wang and Xiaoyu Wang},
journal= {arXiv preprint arXiv:2211.08024},
year = {2023}
}
备注
8 pages, 4 figures, 7 tables. Accepted by IEEE Conference on Computer Vision and Pattern Recognition(CVPR) 2023