中文

TED:通过内部泛化加速模型训练

机器学习 2025-09-16 v3

摘要

大型语言模型近年来表现出强大的性能,但其训练成本高昂,驱动了压缩数据集大小的高效方法需求。我们提出了TED剪枝方法,旨在通过量化模型在剪枝后数据上性能提升能力(即Internal Generalization, IG),以拟合保留数据的能力,来解决在高剪枝比率下过拟合的挑战。TED基于Internal Generalization Distance (IGD)的优化目标,衡量剪枝前后IG的变化,以与真实泛化性能一致并实现隐式正则化。我们验证了IGD优化目标使模型能够获得最小的泛化误差上界。通过研究小幅mask扰动对IG的影响,并运用泰勒近似,实现了IGD的快速估计。在分析连续训练动力学时,验证了IGD的先验效应,并提出了渐进式剪枝策略。在图像分类、自然语言理解和大型语言模型微调实验中,TED以60-70%的数据实现无损性能。待论文接受后,我们的代码将公开发布。

关键词

引用

@article{arxiv.2405.03228,
  title  = {TED: Accelerate Model Training by Internal Generalization},
  author = {Jinying Xiao and Ping Li and Jie Nie},
  journal= {arXiv preprint arXiv:2405.03228},
  year   = {2025}
}

备注

ECAI 2024