中文

基于 Transformer 模型的块级比特压缩

计算与语言 2023-04-04 v2 机器学习

摘要

随着以 BERT、GPT-3 和 ChatGPT 为代表的近期 Transformer 基模型的流行,一系列自然语言处理任务取得了最先进的性能。然而,Transformer 基模型巨大的计算量、庞大的内存占用以及由此产生的高延迟,对具有高实时性要求的云端服务而言是不可回避的挑战。为解决该问题,我们提出 BBCT,一种无需重训练的 Transformer 块级比特压缩方法。我们的方法实现了对整个 Transformer 更细粒度的压缩,包括嵌入、矩阵乘法、GELU、softmax、层归一化以及所有中间结果。作为案例,我们使用 BBCT 方法压缩了一个高效 BERT。我们在通用语言理解评估(GLUE)上的基准测试结果表明,BBCT 在大多数任务中能实现低于 1% 的精度下降。

关键词

引用

@article{arxiv.2303.09184,
  title  = {Block-wise Bit-Compression of Transformer-based Models},
  author = {Gaochen Dong and Wei Chen},
  journal= {arXiv preprint arXiv:2303.09184},
  year   = {2023}
}

备注

Need to add figures and adjust languages to improve readability