变形器泛化行为的更精细图景
机器学习
2026-05-27 v2 人工智能
摘要
我们从变形器目标函数傅里叶谱的角度研究其泛化行为。与先前工作(Edelman 等,2022;Trauger & Tosh,2024)不同,后者从Rademacher复杂度出发推导泛化上界,我们研究通过PAC-Bayes理论获取泛化上界的可行性。我们表明,稀疏谱集中在低阶分量可实现良好泛化性能的低锋利性构造。我们的思路是表明实现任何稀疏度不超过上下文长度的布尔函数的平坦最小值的存在,然后应用于理想化的低锋利性学习器, resulting in a non-vacuous generalization bound. 我们利用这一点,对链式思维为高阶目标函数改善泛化的正式解释,并表明我们边界中的复杂度参数可通过属性测试高效估计。我们对预测进行实证评估,并进行机制性可解释性研究以支持理论构造在真实变形器中的现实性。
引用
@article{arxiv.2605.20988,
title = {A Sharper Picture of Generalization in Transformers},
author = {Paul Lintilhac and Sair Shaikh},
journal= {arXiv preprint arXiv:2605.20988},
year = {2026}
}
备注
10 pages, 9 figures, 41 pages of supplementary material