重尾普适性预测超大预训练深度神经网络的测试精度趋势
机器学习
2020-01-28 v2 计算机视觉与模式识别
机器学习
摘要
给定两个或更多具有相同/相似架构、在同一数据集上训练但采用不同求解器、参数、超参数、正则化等训练的深层神经网络(DNNs),我们能否预测哪个 DNN 将具有最佳测试精度,且无需窥探测试数据?本文展示如何利用一种新提出的重尾自正则化(HT-SR)理论来回答此问题。HT-SR 除其他外表明,现代 DNN 展现出我们称之为重尾机制普适性(HT-MU)的现象,即层权重矩阵中的相关性可拟合为幂律(PL),其指数落自重尾随机矩阵理论(HT-RMT)的通用普适性类。由此,我们发展了一种通用容量控制度量,其为 PL 指数的加权平均。我们并非考察小型玩具神经网络,而是检视逾 50 个不同的大规模预训练 DNN,涵盖 15 种不同架构,在 ImageNet 上训练,各自 reported 具有不同测试精度。我们展示这一新容量度量与这些 DNN 所报告的测试精度高度相关,跨各架构(VGG16/.../VGG19、ResNet10/.../ResNet152 等)皆然。我们还展示如何用更熟悉的乘积范数容量度量来近似该度量,即层权重矩阵 log Frobenius 范数的平均。我们的方法无需改动底层 DNN 或其损失函数,无需训练模型(虽可用于监测训练),甚至不需访问 ImageNet 数据。
引用
@article{arxiv.1901.08278,
title = {Heavy-Tailed Universality Predicts Trends in Test Accuracies for Very Large Pre-Trained Deep Neural Networks},
author = {Charles H. Martin and Michael W. Mahoney},
journal= {arXiv preprint arXiv:1901.08278},
year = {2020}
}
备注
Updated as will appear in SDM20