Machine Learning · Computer Science
Imbalanced Gradients in RL Post-Training of Multi-Task LLMs
Runzhe Wu, Ankur Samanta, Ayush Jain, Scott Fujimoto +6
2025-10-28
Computation and Language · Computer Science
Mid-Training of Large Language Models: A Survey
Kaixiang Mo, Yuxin Shi, Weiwei Weng, Zhiqiang Zhou +3
2025-10-09
Computation and Language · Computer Science
Spike No More: Stabilizing the Pre-training of Large Language Models
Sho Takase, Shun Kiyono, Sosuke Kobayashi, Jun Suzuki
2025-07-28
Machine Learning · Computer Science
How Learning Rate Decay Wastes Your Best Data in Curriculum-Based LLM Pretraining
Kairong Luo, Zhenbo Sun, Haodong Wen, Xinyu Shi +4
2026-05-15
Computation and Language · Computer Science
GrowLength: Accelerating LLMs Pretraining by Progressively Growing Training Length
Hongye Jin, Xiaotian Han, Jingfeng Yang, Zhimeng Jiang +2
2023-10-03
Machine Learning · Computer Science
Early Weight Averaging meets High Learning Rates for LLM Pre-training
Sunny Sanyal, Atula Neerkaje, Jean Kaddour, Abhishek Kumar +1
2023-12-13
Computation and Language · Computer Science
Methods of improving LLM training stability
Oleg Rybakov, Mike Chrzanowski, Peter Dykas, Jinze Xue +1
2024-10-23
Computation and Language · Computer Science
Continual Learning for Large Language Models: A Survey
Tongtong Wu, Linhao Luo, Yuan-Fang Li, Shirui Pan +2
2024-02-08
Artificial Intelligence · Computer Science
Enhancing Large Language Model Performance with Gradient-Based Parameter Selection
Haoling Li, Xin Zhang, Xiao Liu, Yeyun Gong +3
2025-02-14
Machine Learning · Computer Science
On the Overlooked Pitfalls of Weight Decay and How to Mitigate Them: A Gradient-Norm Perspective
Zeke Xie, Zhiqiang Xu, Jingzhao Zhang, Issei Sato +1
2024-08-19
Machine Learning · Computer Science
Rethinking Learning Rate Tuning in the Era of Large Language Models
Hongpeng Jin, Wenqi Wei, Xuyu Wang, Wenbin Zhang +1
2023-09-19
Machine Learning · Computer Science
Beyond Precision: Training-Inference Mismatch is an Optimization Problem and Simple LR Scheduling Fixes It
Yaxiang Zhang, Yingru Li, Jiacai Liu, Jiawei Xu +3
2026-02-03
Machine Learning · Computer Science
How Instruction and Reasoning Data shape Post-Training: Data Quality through the Lens of Layer-wise Gradients
Ming Li, Yanhong Li, Ziyue Li, Tianyi Zhou
2026-05-12
Machine Learning · Computer Science
Large Learning Rates Improve Generalization: But How Large Are We Talking About?
Ekaterina Lobacheva, Eduard Pockonechnyy, Maxim Kodryan, Dmitry Vetrov
2023-11-21
Machine Learning · Computer Science
How Does Learning Rate Decay Help Modern Neural Networks?
Kaichao You, Mingsheng Long, Jianmin Wang, Michael I. Jordan
2019-09-27
Computation and Language · Computer Science
Improving the Robustness of Large Language Models via Consistency Alignment
Yukun Zhao, Lingyong Yan, Weiwei Sun, Guoliang Xing +5
2024-03-25
Machine Learning · Computer Science
Weight Decay Improves Language Model Plasticity
Tessa Han, Sebastian Bordt, Hanlin Zhang, Sham Kakade
2026-02-12
Machine Learning · Computer Science
A Common Pitfall of Margin-based Language Model Alignment: Gradient Entanglement
Hui Yuan, Yifan Zeng, Yue Wu, Huazheng Wang +2
2025-04-23
Computer Vision and Pattern Recognition · Computer Science
LLM as a Complementary Optimizer to Gradient Descent: A Case Study in Prompt Tuning
Zixian Guo, Ming Liu, Zhilong Ji, Jinfeng Bai +2
2024-12-05