隐藏与寻找:Transformer 对称性遮蔽锐度,黎曼几何寻得道
机器学习
2025-05-09 v1
摘要
锐度概念已成功应用于传统架构如MLP和CNN,以预测其泛化能力。然而,对于Transformer,最近的工作报告了平坦性与泛化之间的弱相关性。我们认为现有的锐度措施对Transformer无效,因为它们拥有更丰富的注意力机制对称性,这些对称性诱导出参数空间中若干维度,使得网络或其损失保持相同。我们断言,锐度必须充分考虑这些对称性,因此我们在结果为等分流形上的等分上重新定义其锐度,从而消除其歧义性。利用黎曼几何工具,我们提出一种完全通用的锐度概念,基于对称性校正等分流形上的测地球。实际中,我们需要求近似测地。这样做以一阶近似方式导致现有的自适应锐度措施,我们展示了包括更高阶项的重要性,以恢复与泛化的相关性。我们呈现了对对角网络的实验结果,表明我们的测地锐度在真实世界的Transformer上对文本和图像分类任务都显示出强相关性。
关键词
引用
@article{arxiv.2505.05409,
title = {Hide & Seek: Transformer Symmetries Obscure Sharpness & Riemannian Geometry Finds It},
author = {Marvin F. da Silva and Felix Dangel and Sageev Oore},
journal= {arXiv preprint arXiv:2505.05409},
year = {2025}
}