DiJiang:通过紧凑核化实现高效大语言模型
计算与语言
2024-04-02 v2 机器学习
摘要
为了降低 Transformer 的计算负载,线性注意力的研究获得了显著发展。然而,注意力机制的改进策略通常需要大量的重新训练,这对于拥有海量参数的大语言模型来说是不切实际的。本文提出了 DiJiang,一种新颖的频域核化方法,能够以极低的训练成本将预训练的普通 Transformer 转换为线性复杂度模型。通过采用加权拟蒙特卡洛方法进行采样,所提方法在理论上提供了更优的逼近效率。为了进一步降低训练计算复杂度,我们的核化方法基于离散余弦变换(DCT)操作。大量实验表明,所提出的方法在性能上可与原始 Transformer 相媲美,但训练成本显著降低,推理速度大大加快。我们的 DiJiang-7B 在多个基准测试上取得了与 LLaMA2-7B 相当的性能,而训练成本仅为其约 1/50。代码可在 https://github.com/YuchuanTian/DiJiang 获取。
引用
@article{arxiv.2403.19928,
title = {DiJiang: Efficient Large Language Models through Compact Kernelization},
author = {Hanting Chen and Zhicheng Liu and Xutao Wang and Yuchuan Tian and Yunhe Wang},
journal= {arXiv preprint arXiv:2403.19928},
year = {2024}
}