中文

GradSign:具理论洞察的模型性能推断方法

机器学习 2022-06-22 v2

摘要

神经架构搜索(NAS)中的一个关键挑战是快速推断大量网络的预测性能,以发现统计准确且计算高效的网络。我们将此任务称为模型性能推断(MPI)。当前高效的 MPI 做法是基于梯度的方法,利用网络在初始化时的梯度来推断其性能。然而,现有的基于梯度的方法仅依赖启发式度量,缺乏巩固其设计的必要理论基础。我们提出了 GradSign,一种准确、简单且灵活的模型性能推断度量,并附有理论洞察。GradSign 背后的核心思想是通过一个量 Ψ{\Psi} 在单个训练样本的粒度上分析不同网络的优化景观。理论上,我们证明了在合理假设下,网络的训练损失与真实总体损失均被 Ψ{\Psi} 成比例地上界约束。此外,我们设计了 GradSign,即利用网络在随机初始化状态下求得的梯度对 Ψ{\Psi} 进行准确而简单的近似。在跨越三个训练数据集的七个 NAS 基准上的评估表明,GradSign 对真实世界网络具有良好泛化性,并在由 Spearman 的 ρ{\rho} 与 Kendall's Tau 评价的 MPI 上持续优于最先进的基于梯度的方法。此外,我们将 GradSign 集成到四种现有 NAS 算法中,结果表明在三个真实世界任务上,GradSign 辅助的 NAS 算法通过其发现的最佳网络的准确率分别提升多达 0.3%、1.1% 和 1.0%,从而优于其原始版本。

关键词

引用

@article{arxiv.2110.08616,
  title  = {GradSign: Model Performance Inference with Theoretical Insights},
  author = {Zhihao Zhang and Zhihao Jia},
  journal= {arXiv preprint arXiv:2110.08616},
  year   = {2022}
}