基于梯度的早停技术 GradES:加速 Transformer 模型训练
机器学习
2025-10-20 v3 人工智能
摘要
早期停止方法通过监控全局验证损失并同步停止所有参数更新,由于验证推断时间延长,在大型 Transformer 模型上代价高昂。我们提出了\textit{GradES}——一种基于梯度的早停方法,作用于 Transformer 组件(注意力投影和前馈层矩阵)。我们发现,语言模型和视觉-语言模型在微调期间,不同组件的收敛速率存在差异。\textit{GradES}跟踪反向传播过程中这些矩阵梯度变化幅度。当某个投影矩阵的梯度变化幅度低于收敛阈值 时,便从该矩阵的后续更新中排除,消除昂贵的验证计算,同时使慢速收敛矩阵继续学习。\textit{GradES}通过1.57--7.22倍加速训练时间,同时通过防止过拟合提升泛化性能,在语言任务中实现平均准确率提升1.2%,在多模态基准测试中提升3.88%。
关键词
引用
@article{arxiv.2509.01842,
title = {GradES: Significantly Faster Training in Transformers with Gradient-Based Early Stopping},
author = {Qifu Wen and Xi Zeng and Zihan Zhou and Shuaijun Liu and Mehdi Hosseinzadeh and Ningxin Su and Reza Rawassizadeh},
journal= {arXiv preprint arXiv:2509.01842},
year = {2025}
}
备注
20 pages, 5 figures