深度网络从数据中学习对称性的能力:一种神经核理论
机器学习
2025-06-27 v2
摘要
对称性(群作用下的变换)存在于许多数据集中,利用它们有望改善机器学习中的预测。在这项工作中,我们旨在理解深度网络——采用标准架构并以标准监督方式训练——何时以及如何从数据中学习对称性。受现实场景启发,我们研究了一种分类范式,其中数据对称性在训练期间仅被部分观察到:某些类别包含循环群的所有变换,而其他类别仅包含一个子集。在无限宽度极限下(此时核类比适用),我们推导出对称性学习的神经核理论。数据集的群循环性质使我们能够在傅里叶域中分析神经核的Gram矩阵;在这里,我们找到了泛化误差作为类别分离(信号)和类别轨道密度(噪声)的简单刻画。这一刻画表明,只有在架构定义的核空间中,数据的局部结构胜过其非局部的对称诱导结构时,泛化才能成功。我们将理论处理扩展到任意有限群,包括非阿贝尔群。我们的框架也适用于等变架构(例如CNN),并在架构与数据固有对称性匹配的特殊情况下恢复了它们的成功。实验上,我们的理论再现了在旋转MNIST部分观测版本上训练的有限宽度网络(MLP、CNN、ViT)的泛化失败。我们得出结论:传统深度网络缺乏学习那些未事先显式嵌入其架构中的对称性的机制。我们的框架可扩展以指导能够从数据中学习对称性的架构和训练过程的设计。
引用
@article{arxiv.2412.11521,
title = {On the Ability of Deep Networks to Learn Symmetries from Data: A Neural Kernel Theory},
author = {Andrea Perin and Stephane Deny},
journal= {arXiv preprint arXiv:2412.11521},
year = {2025}
}
备注
JMLR accepted version, including an extension of the theory to general finite groups (including non-abelian groups)