中文

子网感知动态超网训练用于神经架构搜索

计算机视觉与模式识别 2025-03-17 v1

摘要

N-shot 神经架构搜索(NAS)利用包含给定搜索空间中所有候选子网的超网。这些子网通常使用静态训练策略(例如对所有子网使用相同的学习率调度器和优化器)进行训练。然而,这并未考虑到各个子网具有不同的特性,导致两个问题:(1)超网训练偏向低复杂度子网(不公平性);(2)超网中的动量更新存在噪声(噪声动量)。我们提出了一种动态超网训练技术,通过自适应调整子网的训练策略来解决这些问题。具体而言,我们引入了一种复杂度感知学习率调度器(CaLR),根据子网的复杂度自适应控制学习率的衰减比例,从而缓解不公平性问题。我们还提出了一种动量分离技术(MS),它将具有相似结构特征的子网分组,并为每组使用独立的动量,从而避免噪声动量问题。我们的方法可以适用于各种 N-shot NAS 方法,且代价极小,同时显著提升搜索性能。我们在多种搜索空间(例如 NAS-Bench-201、Mobilenet 空间)和数据集(例如 CIFAR-10/100、ImageNet)上验证了我们方法的有效性。

关键词

引用

@article{arxiv.2503.10740,
  title  = {Subnet-Aware Dynamic Supernet Training for Neural Architecture Search},
  author = {Jeimin Jeon and Youngmin Oh and Junghyup Lee and Donghyeon Baek and Dohyung Kim and Chanho Eom and Bumsub Ham},
  journal= {arXiv preprint arXiv:2503.10740},
  year   = {2025}
}

备注

Accepted to CVPR 2025