中文

NOBLE:加速 Transformer 的非线性低秩分支

机器学习 2026-03-09 v1 人工智能 计算与语言 神经与进化计算

摘要

我们提出 NOBLE(Nonlinear lOw-rank Branch for Linear Enhancement),一种为 Transformer 线性层添加非线性低秩分支的架构增强方法。与 LoRA 和其他参数高效微调(PEFT)方法不同,NOBLE 旨在从头进行预训练。该分支是架构的永久组成部分,而非冻结权重上进行微调的适配器。该分支计算 {\sigma}(xWdown)Wup,其中 {\sigma} 为可学习的非线性函数。我们评估了几种激活函数,发现 CosNet——一种包含可学习频率和相位的两层余弦非线性函数,其在中间枢轴空间中夹带一个线性投影——性能最佳。NOBLE 以最小的开销实现显著提升:达到基准评估损失的最高速度提升达 1.47 倍(最高可减少 32% 的训练步数),仅增加 4% 的参数和 7% 的步长时间开销,实现最高可达 1.22 倍的实际 wallclock 速度提升。在 LLMs(250M 和 1.5B 参数)、BERT、VQGAN 和 ViT 上均实现了训练效率的显著提升。我们识别出一个注意事项:Mixup/CutMix 数据增强会干扰 Imagenet 分类中 NOBLE 的优势以及其他随机数据增强方法,但在禁用后,ViT 也能获得改进。这一差异可能是由于正则化技术鼓励对目标函数进行更平滑的拟合,而 NOBLE 可能更专注于目标函数的锐利方面。

关键词

引用

@article{arxiv.2603.06492,
  title  = {NOBLE: Accelerating Transformers with Nonlinear Low-Rank Branches},
  author = {Ethan Smith},
  journal= {arXiv preprint arXiv:2603.06492},
  year   = {2026}
}

备注

14 pages, 5 figures, 5 tables