复杂性控制的临界窗口:当 Transformer 决定是推理还是记忆
机器学习
2026-05-07 v1 人工智能
摘要
最近的研究表明,Transformer 的组成推理能力由“复杂性控制”、初始化比例和权重衰减共同决定——后者引导训练走向低复杂度推理解,而非高复杂度记忆解。现有分析然而将复杂性控制视为单一静态超参数,未能回答该控制实际决定性时机。我们表明,记忆与推理的决定权于一个明确可辨的训练窗口内。我们在受控的组成任务上发现:(i) 在训练窗口中仅应用 25% 的权重衰减,即可在 OOD 准确率上与全程训练相当( 对 );(ii) 在保持总正则化预算不变的情况下,将其置于训练中段可实现 OOD 准确率比早期置放高 倍;(iii) 临界窗口边界异常精细,窗口起始偏移仅 次优化步即可使平均 OOD 从机遇率 () 跳至推理区间 ();(iv) 窗口位置随初始化比例系统性变化,但小初始化下的推理解吸引盆地实际收缩,与普遍认为小初始化更优的建议相悖。我们进一步表明,临界窗口现象具有任务特异性:在模块化算术的“grokking”任务中,此现象未显现,恰当调优的恒定权重衰减可与计划权重衰减达成一致。
关键词
引用
@article{arxiv.2605.04396,
title = {Critical Windows of Complexity Control: When Transformers Decide to Reason or Memorize},
author = {Sarwan Ali},
journal= {arXiv preprint arXiv:2605.04396},
year = {2026}
}