中文

GWT: 大规模语言模型训练中可扩展的优化器状态压缩

计算机视觉与模式识别 2025-01-14 v1

摘要

大规模语言模型 (LLM) 已在多样化的自然语言处理基准测试中显示出卓越的能力。然而,模型参数规模的不断攀升在训练期间造成了巨大的内存开销,尤其是在采用有状态优化器(如 Adam)时。传统的内存高效策略,通常涉及奇异值分解 (SVD) 或权重冻结,往往会导致与全秩更新相比的性能下降。为了克服这些限制,本文探索了超出低秩约束的内存高效优化,提出了梯度小波变换 (GWT)。GWT 描述了一种新的压缩框架,将梯度投影到小波子空间,从而在保持关键更新信息的同时实现优化器状态的紧凑。我们在理论和实证方面表明,GWT 可以无缝集成到现有的优化协议中,实现资源高效的训练,而不会牺牲模型保真度。严格的评估涵盖了大规模预训练和特定任务的微调,结果表明,GWT 在性能上与先进的内存高效优化器和全秩更新相当。此外,GWT 提供了一种可扩展且稳健的解决方案,用于管理现代大规模数据工程和知识发现系统中内存密集型的管道。

关键词

引用

@article{arxiv.2501.07236,
  title  = {CSTA: Spatial-Temporal Causal Adaptive Learning for Exemplar-Free Video Class-Incremental Learning},
  author = {Tieyuan Chen and Huabin Liu and Chern Hong Lim and John See and Xing Gao and Junhui Hou and Weiyao Lin},
  journal= {arXiv preprint arXiv:2501.07236},
  year   = {2025}
}

备注

IEEE TCSVT Submission