通过激活值的内在维度关联正则化与泛化
机器学习
2022-11-28 v1 人工智能
摘要
给定一对在训练集上性能相似的模型,自然会假设具有更简单内部表示的模型会表现出更好的泛化能力。在本工作中,我们通过分析模型激活值的内在维度(ID)为这一直觉提供经验证据,ID 可被视为模型对数据表示中变异因素的最小数量。首先,我们表明常见的正则化技术一致地降低了图像分类模型验证集激活值的最后一层 ID(LLID),并展示了这如何强烈影响泛化性能。我们还研究了过度正则化如何降低模型在较早层从数据中提取特征的能力,即使 LLID 持续下降且训练精度保持接近完美,也会对验证精度产生负面影响。最后,我们考察了表现出 grokking 现象的模型在训练过程中的 LLID。我们观察到,在训练精度饱和很久之后,当模型“grok”且验证精度突然从随机提升至完美时,LLID 同时发生突然下降,从而为进一步理解突然泛化的动力学提供了见解。
引用
@article{arxiv.2211.13239,
title = {Relating Regularization and Generalization through the Intrinsic Dimension of Activations},
author = {Bradley C. A. Brown and Jordan Juravsky and Anthony L. Caterini and Gabriel Loaiza-Ganem},
journal= {arXiv preprint arXiv:2211.13239},
year = {2022}
}
备注
NeurIPS 2022 OPT and HITY workshops