TED:通过内部泛化加速模型训练
机器学习
2025-09-16 v3
摘要
大型语言模型近年来表现出强大的性能,但其训练成本高昂,驱动了压缩数据集大小的高效方法需求。我们提出了TED剪枝方法,旨在通过量化模型在剪枝后数据上性能提升能力(即Internal Generalization, IG),以拟合保留数据的能力,来解决在高剪枝比率下过拟合的挑战。TED基于Internal Generalization Distance (IGD)的优化目标,衡量剪枝前后IG的变化,以与真实泛化性能一致并实现隐式正则化。我们验证了IGD优化目标使模型能够获得最小的泛化误差上界。通过研究小幅mask扰动对IG的影响,并运用泰勒近似,实现了IGD的快速估计。在分析连续训练动力学时,验证了IGD的先验效应,并提出了渐进式剪枝策略。在图像分类、自然语言理解和大型语言模型微调实验中,TED以60-70%的数据实现无损性能。待论文接受后,我们的代码将公开发布。
引用
@article{arxiv.2405.03228,
title = {TED: Accelerate Model Training by Internal Generalization},
author = {Jinying Xiao and Ping Li and Jie Nie},
journal= {arXiv preprint arXiv:2405.03228},
year = {2025}
}
备注
ECAI 2024