中文

用于神经架构搜索的无训练模型性能估计

机器学习 2021-10-01 v2

摘要

神经架构搜索已成为深度学习领域不可或缺的一部分。现代方法能够找到性能最佳的架构之一,或从零开始构建,但它们通常基于训练后的精度信息做出决策。在本文中,我们转而探索神经网络的架构组件如何影响其预测能力。我们通过考虑多次初始化的统计信息,关注架构的训练后精度与其训练前精度之间的关系。我们观察到,最小化未训练精度的变异系数 CVUCV_{U} 始终能带来性能更好的架构。我们使用已训练神经架构数据库 NAS-Bench-201 将 CVUCV_{U} 作为神经架构搜索的评分指标进行测试。具有最低 CVUCV_{U} 值的架构在 CIFAR-10、CIFAR-100 和降采样版 ImageNet 上的平均精度分别为 91.90±2.2791.90 \pm 2.2764.08±5.6364.08 \pm 5.6338.76±6.6238.76 \pm 6.62。由于这些数值在统计上高于随机基线,我们得出结论:好的架构应当对权重初始化具有稳定性。在批大小为 256256 的图像、进行 100100 次初始化的条件下,处理 100100 个架构在 CIFAR-10 和 CIFAR-100 上约需 190190 秒,在 ImageNet16-120 上需 133.9133.9 秒。

关键词

引用

@article{arxiv.2103.08312,
  title  = {Trainless Model Performance Estimation for Neural Architecture Search},
  author = {Ekaterina Gracheva},
  journal= {arXiv preprint arXiv:2103.08312},
  year   = {2021}
}