中文

语言模型作为零样本无损梯度压缩器:迈向通用神经参数先验模型

机器学习 2025-01-23 v2 人工智能

摘要

尽管统计先验模型在各个领域被广泛使用,但针对神经网络梯度的此类模型长期以来一直被忽视。其固有挑战源于梯度的高维结构和复杂相互依赖性,这给有效建模带来了困难。在这项工作中,我们展示了大型语言模型(LLMs)在零样本设置中作为梯度先验的潜力。我们通过考虑无损梯度压缩(分布式学习中的一个关键应用)来检验这一特性,该应用高度依赖于精确的概率建模。为此,我们引入了LM-GC,一种将LLMs与算术编码相结合的新方法。我们的技术将普通梯度转换为类似文本的格式,与普通表示相比,其token效率提高了多达38倍。我们确保这种数据转换与普通梯度的结构以及LLMs通常识别的符号保持紧密对齐。我们的实验表明,LM-GC超越了现有的最先进无损压缩方法,在各种数据集和架构上将压缩率提高了10%到17.2%。此外,我们的方法显示出与量化、稀疏化等有损压缩技术良好的兼容性。这些发现凸显了LLMs作为有效处理梯度模型的巨大潜力。代码可在https://github.com/hui-po-wang/LM-GC获取。

关键词

引用

@article{arxiv.2409.17836,
  title  = {Language Models as Zero-shot Lossless Gradient Compressors: Towards General Neural Parameter Prior Models},
  author = {Hui-Po Wang and Mario Fritz},
  journal= {arXiv preprint arXiv:2409.17836},
  year   = {2025}
}

备注

camera-ready in NeurIPS 2024