中文

基于梯度的早停技术 GradES:加速 Transformer 模型训练

机器学习 2025-10-20 v3 人工智能

摘要

早期停止方法通过监控全局验证损失并同步停止所有参数更新,由于验证推断时间延长,在大型 Transformer 模型上代价高昂。我们提出了\textit{GradES}——一种基于梯度的早停方法,作用于 Transformer 组件(注意力投影和前馈层矩阵)。我们发现,语言模型和视觉-语言模型在微调期间,不同组件的收敛速率存在差异。\textit{GradES}跟踪反向传播过程中这些矩阵梯度变化幅度。当某个投影矩阵的梯度变化幅度低于收敛阈值 τ\tau 时,便从该矩阵的后续更新中排除,消除昂贵的验证计算,同时使慢速收敛矩阵继续学习。\textit{GradES}通过1.57--7.22倍加速训练时间,同时通过防止过拟合提升泛化性能,在语言任务中实现平均准确率提升1.2%,在多模态基准测试中提升3.88%。

关键词

引用

@article{arxiv.2509.01842,
  title  = {GradES: Significantly Faster Training in Transformers with Gradient-Based Early Stopping},
  author = {Qifu Wen and Xi Zeng and Zihan Zhou and Shuaijun Liu and Mehdi Hosseinzadeh and Ningxin Su and Reza Rawassizadeh},
  journal= {arXiv preprint arXiv:2509.01842},
  year   = {2025}
}

备注

20 pages, 5 figures