SelfCP:基于冻结的大语言模型自压缩超限提示
计算与语言
2024-09-04 v2
摘要
长提示在使用基于变换器的大语言模型(LLM)时会导致巨大的硬件成本。不幸的是,许多任务(如摘要)不可避免地引入长文档,以及基于情境学习的广泛应用会使提示长度失控。本文提出了自压缩器(SelfCP),其采用目标LLM本身来压缩超限提示为密集向量,同时保持允许的提示不变。密集向量随后通过可学习的连接器投影为密集标记,从而使同一LLM能够轻松理解。该连接器在目标LLM保持冻结期间,受监督调优,基于来自公开数据集中选取的相对长文本进行语言建模监督,涉及指令数据集以使SelfCP能够响应各种提示。我们在两个不同的骨干网络上构建轻量级SelfCP,仅使用来自连接器和可学习嵌入的1700万可学习参数。针对英文和中文基准测试的评估表明,SelfCP有效地将12倍的超限提示替换为密集标记,从而降低内存成本并提升推理吞吐量,同时改善响应质量。卓越的性能为LLM在不从头训练的情况下处理长提示提供了高效解决方案。
引用
@article{arxiv.2405.17052,
title = {SelfCP: Compressing Over-Limit Prompt via the Frozen Large Language Model Itself},
author = {Jun Gao and Ziqiang Cao and Wenjie Li},
journal= {arXiv preprint arXiv:2405.17052},
year = {2024}
}