中文

表示几何与深度神经网络泛化之间的关系

机器学习 2026-03-04 v2

摘要

我们探讨了表示几何与神经网络性能之间的关系。通过分析 52 个在 ImageNet 上预训练的模型(跨 13 个架构族),我们展示有效维度——一种无监督几何指标——能强烈预测准确率。经过控制模型容量后,输出有效维度实现部分相关系数 r=0.75(p<1010p < 10^{-10}),而总压缩实现部分相关系数 r=-0.72。这些发现在 ImageNet 和 CIFAR-10 上复现,并推广到 NLP 领域:有效维度在 SST-2/MNLI 上的 8 个编码器模型以及 AG News 上的 15 个解码器 LLM 中预测性能(r=0.69, p=0.004),而模型规模不行(r=0.07)。我们确立了双向因果关系:通过噪声降低几何会导致准确率下降(r=-0.94, p<109p < 10^{-9}),而通过 PCA 改善几何在不同架构下保持准确率(-0.03pp,95% 方差)。该关系对噪声类型不敏感——高斯、均匀、Dropout 和盐粒噪声均显示 r>0.90|r| > 0.90。这些结果表明,有效维度提供了关于神经网络性能的领域无关性预测与因果信息,且完全无需标签即可计算。

关键词

引用

@article{arxiv.2602.00130,
  title  = {On the Relationship Between Representation Geometry and Generalization in Deep Neural Networks},
  author = {Sumit Yadav},
  journal= {arXiv preprint arXiv:2602.00130},
  year   = {2026}
}

备注

pre-print