面向预定义KV缓存容量的大型语言模型构建方法
高能物理 - 唯象学
2024-11-26 v1
摘要
本文提出了一种新方法,称为受限缓存转换器(Bounded-Cache Transformer, BCT),用于构建具有预定义键值(KV)缓存容量的大型语言模型。BCT通过实施受限长度KV缓存来解决传统KV缓存中过度内存消耗的问题,这特别适用于Transformer解码器架构中的注意力层。通过动态更新键值向量序列,BCT实现了在有限缓存容量内的高效推理,显著降低了内存使用,同时保持了模型性能和系统吞吐量。实验结果表明,BCT在保持模型推理质量的同时,显著降低了内存使用,为大型语言模型的高效推理提供了新解决方案。
关键词
引用
@article{arxiv.2411.15784,
title = {Type I seesaw mechanism at TeV scale or below with minimal fields},
author = {Kunal Pandey and Rathin Adhikari},
journal= {arXiv preprint arXiv:2411.15784},
year = {2024}
}