Computation and Language · Computer Science
DeepNet: Scaling Transformers to 1,000 Layers
Hongyu Wang, Shuming Ma, Li Dong, Shaohan Huang +2
2022-03-02
Machine Learning · Computer Science
Learning in Compact Spaces with Approximately Normalized Transformer
Jörg K. H. Franke, Urs Spiegelhalter, Marianna Nezhurina, Jenia Jitsev +2
2025-11-20
Computation and Language · Computer Science
Noise Stability Regularization for Improving BERT Fine-tuning
Hang Hua, Xingjian Li, Dejing Dou, Cheng-Zhong Xu +1
2021-07-13
Machine Learning · Computer Science
BranchNorm: Robustly Scaling Extremely Deep Transformers
Yijin Liu, Xianfeng Zeng, Fandong Meng, Jie Zhou
2023-05-05
Computation and Language · Computer Science
Progressively Stacking 2.0: A Multi-stage Layerwise Training Method for BERT Training Speedup
Cheng Yang, Shengnan Wang, Chao Yang, Yuechuan Li +2
2020-11-30
Machine Learning · Computer Science
Farkas layers: don't shift the data, fix the geometry
Aram-Alexandre Pooladian, Chris Finlay, Adam M Oberman
2019-10-08
Machine Learning · Computer Science
Training Graph Neural Networks with 1000 Layers
Guohao Li, Matthias Müller, Bernard Ghanem, Vladlen Koltun
2022-04-12
Machine Learning · Computer Science
SimpleGPT: Improving GPT via A Simple Normalization Strategy
Marco Chen, Xianbiao Qi, Yelin He, Jiaquan Ye +1
2026-02-03
Computation and Language · Computer Science
Visualizing and Understanding the Effectiveness of BERT
Yaru Hao, Li Dong, Furu Wei, Ke Xu
2019-08-16
Computation and Language · Computer Science
Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism
Mohammad Shoeybi, Mostofa Patwary, Raul Puri, Patrick LeGresley +2
2020-03-17
Computation and Language · Computer Science
Q8BERT: Quantized 8Bit BERT
Ofir Zafrir, Guy Boudoukh, Peter Izsak, Moshe Wasserblat
2021-12-20
Machine Learning · Computer Science
Experimenting with Normalization Layers in Federated Learning on non-IID scenarios
Bruno Casella, Roberto Esposito, Antonio Sciarappa, Carlo Cavazzoni +1
2023-03-21
Machine Learning · Computer Science
Layer-Parallel Training for Transformers
Shuai Jiang, Marc Salvadó-Benasco, Eric C. Cyr, Alena Kopaničáková +2
2026-01-27
Machine Learning · Computer Science
Scalable Methods for 8-bit Training of Neural Networks
Ron Banner, Itay Hubara, Elad Hoffer, Daniel Soudry
2018-06-19
Machine Learning · Computer Science
On the Stability of Fine-tuning BERT: Misconceptions, Explanations, and Strong Baselines
Marius Mosbach, Maksym Andriushchenko, Dietrich Klakow
2021-03-26
Machine Learning · Computer Science
Regularising Deep Networks with Deep Generative Models
Matthew Willetts, Alexander Camuto, Stephen Roberts, Chris Holmes
2019-10-14