LAuReL:学习增强残差层
机器学习
2025-06-25 v4 人工智能
计算机视觉与模式识别
摘要
高效深度学习方法的核心支柱之一是架构改进,如残差/跳跃连接,这显著改善了模型收敛和质量。此后,残差连接不仅在卷积神经网络中,也在作为大语言模型骨干的基于 Transformer 的架构中变得无处不在。本文提出学习增强残差层——一种对标准残差连接的新颖泛化,旨在作为其原地替代品,同时在模型质量和占用指标上超越它。实验表明,使用 LAuReL 可提升视觉和语言模型的性能。例如,在 ResNet-50、ImageNet 1K 任务上,它实现了增加一层所带来的 60% 增益,仅增加 0.003% 的参数,且在增加参数量少 2.6 倍的情况下达到相同效果。类似地,在预训练 1B 和 4B 参数的大语言模型时,LAuReL 在多项具有挑战性的下游评估任务上将性能提升 2.54% 至 20.05%,分别仅增加 0.012% 和 0.1% 的额外参数。
引用
@article{arxiv.2411.07501,
title = {LAuReL: Learned Augmented Residual Layer},
author = {Gaurav Menghani and Ravi Kumar and Sanjiv Kumar},
journal= {arXiv preprint arXiv:2411.07501},
year = {2025}
}
备注
Accepted at 42nd International Conference on Machine Learning (2025), Vancouver, Canada