从架构表征推断卷积神经网络的准确率
计算机视觉与模式识别
2020-01-13 v2 机器学习
高能物理 - 实验
摘要
卷积神经网络(CNNs)在分析来自许多领域(包括粒子成像探测器)的科学数据方面已显示出强劲前景。然而,针对特定应用和不同数据集选择合适的网络架构(深度、核形状、激活函数等)这一挑战仍知之甚少。在本文中,我们通过提出一种系统性的语言来研究 CNN 架构与其性能之间的关系,该语言有助于在训练前对不同 CNN 架构进行比较。我们通过不同属性来表征 CNN 的架构,并证明这些属性可以预测网络在两个特定的基于计算机视觉的物理问题中的性能——费米国家加速器实验室 MINERvA 实验中的事件顶点寻找与强子多重数分类。在此过程中,我们从针对这些物理问题的优化网络架构中提取出若干架构属性,这些架构是称为多节点进化深度学习神经网络(MENNDL)的模型选择算法的输出。我们使用机器学习模型在训练前预测一个网络是否能优于某一阈值准确率。这些模型的性能比随机猜测高出 16–20%。此外,我们发现对于一个普通最小二乘模型,在针对大量网络种群的准确率回归中,其决定系数为 0.966。
引用
@article{arxiv.2001.02160,
title = {Inferring Convolutional Neural Networks' accuracies from their architectural characterizations},
author = {Duc Hoang and Jesse Hamer and Gabriel N. Perdue and Steven R. Young and Jonathan Miller and Anushree Ghosh},
journal= {arXiv preprint arXiv:2001.02160},
year = {2020}
}
备注
6 pages, 5 figures, 5 tables, to appear in proceedings of the 18th International Conference on Machine Learning and Applications - ICMLA 2019