中文

深度学习竞赛的复盘:辛普森悖论及规模度量与形状度量的互补作用

机器学习 2022-02-09 v2 机器学习

摘要

为了更好地理解最先进神经网络(NN)模型的良好泛化性能,特别是基于重尾自正则化(HT-SR)理论的ALPHAHAT度量的成功,我们分析了一个公开可用的模型语料库,该语料库来自一项预测NN泛化精度的竞赛。这些模型质量参差不齐,并采用了一系列架构和正则化超参数进行训练。我们将ALPHAHAT拆解为两个子分量度量:基于规模的度量;以及基于形状的度量。我们发现了一种相当于辛普森悖论的现象:其中“规模”度量(来自传统统计学习理论)在总体中表现良好,但当正则化超参数变化时,在给定深度的数据子划分上可能表现糟糕;而“形状”度量(来自HT-SR理论)在给定深度的模型超参数变化时在每个数据子划分上表现良好,但当具有不同深度的模型聚合在一起时总体上可能表现糟糕。我们的结果凸显了在架构和超参数同时变化时所比较模型的微妙性;在理解NN模型质量时隐式规模参数与隐式形状参数的互补作用;以及超越基于泛化理论上界的千篇一律度量来描述NN模型性能的需求。我们的结果也进一步阐明了为何来自HT-SR理论的ALPHAHAT度量在预测广泛CV和NLP模型泛化能力时如此有效。

关键词

引用

@article{arxiv.2106.00734,
  title  = {Post-mortem on a deep learning contest: a Simpson's paradox and the complementary roles of scale metrics versus shape metrics},
  author = {Charles H. Martin and Michael W. Mahoney},
  journal= {arXiv preprint arXiv:2106.00734},
  year   = {2022}
}

备注

21 pages; 9 figures; 6 tables