ExCP:通过权重-动量联合压缩实现极端 LLM 检查点压缩
机器学习
2024-06-18 v1
摘要
大型语言模型(Large Language Models, LLM)最近在人工智能领域引起了广泛关注。然而,这些模型的训练过程在计算和存储容量方面面临重大挑战,因此对检查点的压缩已成为迫切需要解决的问题。本文提出了一种新型极端检查点压缩(ExCP)框架,显著降低了训练检查点所需的存储空间,同时几乎保持原始性能。我们首先计算相邻检查点的残差,以获得更高压缩比所必需的关键但稀疏信息。为进一步挖掘检查点中的冗余参数,我们提出了一种权重-动量联合压缩方法,利用模型优化过程中另一重要信息,即动量。具体而言,我们利用模型和优化器的双重信息,在尽可能多地丢弃参数的同时,保留关键信息以确保最佳性能。此外,我们采用非均匀量化进一步压缩检查点的存储。我们在参数范围从410M至7B的多个模型上广泛评估了所提出的ExCP框架,展示了在保持强大性能方面的显著存储降低。例如,我们实现了对Pythia-410M模型实现约70倍的压缩,最终性能在各种下游任务上与原始模型相当。代码将在https://github.com/Gaffey/ExCP提供。
引用
@article{arxiv.2406.11257,
title = {ExCP: Extreme LLM Checkpoint Compression via Weight-Momentum Joint Shrinking},
author = {Wenshuo Li and Xinghao Chen and Han Shu and Yehui Tang and Yunhe Wang},
journal= {arXiv preprint arXiv:2406.11257},
year = {2024}
}
备注
ICML 2024 oral