PA&DA:联合采样路径与数据以实现一致性 NAS
计算机视觉与模式识别
2023-03-01 v1 机器学习
摘要
基于权重共享机制,一次性 NAS 方法训练一个超网然后继承预训练权重来评估子模型,大幅降低搜索成本。然而,若干工作已指出共享权重在训练期间遭受不同的梯度下降方向。我们进一步发现超网训练中出现大梯度方差,这降低了超网排序一致性。为缓解该问题,我们提出通过联合优化路径与数据的采样分布(PA&DA)来显式最小化超网训练的梯度方差。我们从理论上推导了梯度方差与采样分布的关系,并揭示最优采样概率正比于路径与训练数据的归一化梯度范数。因此,我们使用归一化梯度范数作为路径与训练数据的重要性指标,并采用重要性采样策略进行超网训练。我们的方法仅需可忽略的计算成本来优化路径与数据的采样分布,却在超网训练中实现了更低梯度方差与更好泛化性能,从而得到更具一致性的 NAS。我们在多种搜索空间中与其他改进方法进行了全面比较。结果表明,我们的方法以更可靠的排序性能与更高搜索架构精度超越其他方法,显示了方法的有效性。代码见 https://github.com/ShunLu91/PA-DA。
引用
@article{arxiv.2302.14772,
title = {PA&DA: Jointly Sampling PAth and DAta for Consistent NAS},
author = {Shun Lu and Yu Hu and Longxing Yang and Zihao Sun and Jilin Mei and Jianchao Tan and Chengru Song},
journal= {arXiv preprint arXiv:2302.14772},
year = {2023}
}
备注
To appear in CVPR 2023; we will update the camera-ready version soon