内在任务对称性驱动算法任务中的泛化
机器学习
2026-03-03 v1 人工智能
摘要
Grokking(从记忆到泛化的突然性转变)以低维表示的出现为特征标志,然而其背后机制仍是谜团。我们提出,内在任务对称性主要驱动了 Grokking,并塑造了模型表示空间的几何结构。我们识别出 Grokking 背后一致的三个阶段训练动力学:(i) 记忆,(ii) 对称性获取,(iii) 几何组织。我们表明,泛化是在对称性获取阶段出现的,此后表示将重新组织为结构化、任务对齐的几何。我们在包括代数、结构和关系推理任务在内的多种算法领域验证了这一对称性驱动的模型。基于这些发现,我们引入一种对称性基准诊断工具,可预测泛化开始的时间点,并提出加速其实现的策略。我们的研究结果表明,内在对称性是神经网络超越记忆、实现稳健算法推理的关键因素。
引用
@article{arxiv.2603.01968,
title = {Intrinsic Task Symmetry Drives Generalization in Algorithmic Tasks},
author = {Hyeonbin Hwang and Yeachan Park},
journal= {arXiv preprint arXiv:2603.01968},
year = {2026}
}
备注
Preprint