NEAR:一种无需训练的机器学习模型性能预估方法
机器学习
2025-02-20 v2 无序系统与神经网络
化学物理
数据分析、统计与概率
摘要
人工神经网络已被证明在自然语言处理和图像识别等众多应用领域是领先的机器学习模型。然而,构建高性能神经网络需要大量计算资源且过程繁琐。神经网络架构搜索(NAS)通过自动从多个候选网络中选择最优网络来解决此问题。虽然许多NAS方法仍需要训练(部分)神经网络,但零成本代理工具可在不训练的情况下识别最优网络。本文提出了基于神经网络层在激活函数应用前后激活矩阵有效秩的“网络可表达性”(Network Expressivity by Activation Rank,NEAR)零成本代理方法。我们在NAS-Bench-101和NATS-Bench-SSS/TSS上展示了该网络评分与模型准确率之间的卓越相关性。此外,我们Present了一种简单方法来估计多层感知器的最优层大小。进一步我们展示,该评分可用于选择超参数,如激活函数和神经网络权重初始化方案。
引用
@article{arxiv.2408.08776,
title = {NEAR: A Training-Free Pre-Estimator of Machine Learning Model Performance},
author = {Raphael T. Husistein and Markus Reiher and Marco Eckhoff},
journal= {arXiv preprint arXiv:2408.08776},
year = {2025}
}
备注
21 pages, 9 figures, 13 tables