训练具有强制Lipschitz常数的Transformer
机器学习
2025-07-18 v1
摘要
神经网络通常对输入和权重扰动高度敏感。这种敏感性与对抗样本的脆弱性、发散训练和过拟合等病理现象有关。为了解决这些问题,过去的研究着眼于完全由Lipschitz组件构建神经网络。然而,这些技术尚未成熟到研究人员能够训练一个像Transformer这样的现代架构,并在初始化之后仍能强制执行Lipschitz证书。为了探索这一空白,我们首先开发并基准测试了新颖的、计算高效的用于维护范数约束权重矩阵的工具。应用这些工具,我们能够训练在整个训练过程中都强制执行Lipschitz边界的Transformer模型。我们发现优化器动态很重要:从AdamW切换到Muon改进了标准方法——权重衰减和谱归一化——使得模型能够在达到相同性能的同时具有更低的Lipschitz边界。受Muon更新具有固定谱范数的启发,我们共同设计了一种权重约束方法,该方法在MLP和200万参数Transformer上改善了Lipschitz与性能之间的权衡。我们的2-Lipschitz Transformer在莎士比亚文本上达到了60%的验证准确率。扩展到1.45亿参数,我们的10-Lipschitz Transformer在互联网文本上达到了21%的准确率。然而,为了匹配NanoGPT基线39.4%的验证准确率,我们的Lipschitz上界增加到了10^264。尽管如此,我们的Lipschitz Transformer在训练时无需层归一化、QK归一化和logit tanh softcapping等稳定性措施。
引用
@article{arxiv.2507.13338,
title = {Training Transformers with Enforced Lipschitz Constants},
author = {Laker Newhouse and R. Preston Hess and Franz Cesista and Andrii Zahorodnii and Jeremy Bernstein and Phillip Isola},
journal= {arXiv preprint arXiv:2507.13338},
year = {2025}
}