表示几何与深度神经网络泛化之间的关系
机器学习
2026-03-04 v2
摘要
我们探讨了表示几何与神经网络性能之间的关系。通过分析 52 个在 ImageNet 上预训练的模型(跨 13 个架构族),我们展示有效维度——一种无监督几何指标——能强烈预测准确率。经过控制模型容量后,输出有效维度实现部分相关系数 r=0.75(),而总压缩实现部分相关系数 r=-0.72。这些发现在 ImageNet 和 CIFAR-10 上复现,并推广到 NLP 领域:有效维度在 SST-2/MNLI 上的 8 个编码器模型以及 AG News 上的 15 个解码器 LLM 中预测性能(r=0.69, p=0.004),而模型规模不行(r=0.07)。我们确立了双向因果关系:通过噪声降低几何会导致准确率下降(r=-0.94, ),而通过 PCA 改善几何在不同架构下保持准确率(-0.03pp,95% 方差)。该关系对噪声类型不敏感——高斯、均匀、Dropout 和盐粒噪声均显示 。这些结果表明,有效维度提供了关于神经网络性能的领域无关性预测与因果信息,且完全无需标签即可计算。
引用
@article{arxiv.2602.00130,
title = {On the Relationship Between Representation Geometry and Generalization in Deep Neural Networks},
author = {Sumit Yadav},
journal= {arXiv preprint arXiv:2602.00130},
year = {2026}
}
备注
pre-print