利用 Gist 令牌学习压缩提示
计算与语言
2024-02-14 v3
摘要
提示是使用语言模型(LM)多任务能力的主要方式,但提示占据了输入上下文窗口中的宝贵空间,且重复编码相同提示在计算上效率低下。微调与蒸馏方法允许在无提示情况下专门化 LM,但需要对每个任务重新训练模型。为彻底避免这一权衡,我们提出 gisting,其训练 LM 将提示压缩为更小的“gist”令牌集合,这些令牌可被缓存并重用以提升计算效率。Gist 模型可通过仅修改 Transformer 注意力掩码以鼓励提示压缩,在标准指令微调之上零额外成本训练。在解码器(LLaMA-7B)与编码器-解码器(FLAN-T5-XXL)LM 上,gisting 可实现高达 26 倍的提示压缩,带来高达 40% 的 FLOPs 削减、4.2% 的墙钟时间加速以及存储节省,且输出质量损失极小。
引用
@article{arxiv.2304.08467,
title = {Learning to Compress Prompts with Gist Tokens},
author = {Jesse Mu and Xiang Lisa Li and Noah Goodman},
journal= {arXiv preprint arXiv:2304.08467},
year = {2024}
}
备注
NeurIPS 2023, 26 pages. Version 3 updates preprint to camera-ready version and clarifies some writing in places