中文

稀疏数据学习模型的几何结构

机器学习 2026-05-18 v2

摘要

流形假设(manifold hypothesis, MH)常用于解释机器学习如何克服维度灾难。然而,MH仅适用于训练数据提供足够稠密样本的底层低维数据流形,或该低维流形在可想象范围内存在的情形。我们将MH不适用的情形称为稀疏 regime。本文表明,在稀疏 regime中,模型通过利用高度结构化的局部几何特征成功工作,这一属性我们formalize为normal alignment。我们证明,normal-aligned分类器——其输入输出Jacobians为秩一且与训练数据完全对齐——在范数约束下最小化训练目标,并在非零Jacobians约束下实现最大局部鲁棒性。对于连续分段仿射深度网络,normal alignment在网络诱导的power diagram分区中表现为质心对齐,并源于特征学习 regime。鼓励这些理论洞察,我们引入GrokAlign,一种主动诱导normal alignment的正则化策略。我们展示,GrokAlign显著加速了与grokking现象相关的深度网络训练动力学。此外,我们将normal alignment原理应用于递归特征机器(Recursive Feature Machines, RFMs),以引入递归特征对齐机器(Recursive Feature Alignment Machines, RFAMs)。我们表明,RFAMs在基于表格数据的训练中表现出比RFMs更强的对抗鲁棒性。

关键词

引用

@article{arxiv.2605.08464,
  title  = {The Geometric Structure of Models Learning Sparse Data},
  author = {Thomas Walker and T. Mitchell Roddenberry and Ahmed Imtiaz Humayun and Randall Balestriero and Richard Baraniuk},
  journal= {arXiv preprint arXiv:2605.08464},
  year   = {2026}
}

备注

27 pages, 7 figures, 5 tables