中文

LanguaShrink:利用心理语言学减少令牌开销

计算与语言 2024-09-04 v1 机器学习

摘要

随着大语言模型(LLMs)处理复杂任务的能力不断提升,长提示带来的计算成本和效率问题日益突出。为加速模型推理并降低成本,我们提出了一种创新的提示压缩框架,名为 LanguaShrink。受大语言模型性能依赖于输入提示中关键信息的密度和位置这一观察启发,LanguaShrink 利用心理语言学原理和艾宾浩斯记忆曲线来实现任务无关的提示压缩。这有效地减少了提示长度,同时保留了必要信息。我们参考了 OpenChat 的训练方法。该框架引入了词性优先级压缩和数据蒸馏技术,使用较小的模型来学习压缩目标,并采用 KL 正则化强化学习策略进行训练。此外,我们采用基于块的压缩算法以实现可调节的压缩率。我们在多个数据集上评估了我们的方法,包括 LongBench、ZeroScrolls、Arxiv Articles 以及一个新构建的小说测试集。实验结果表明,LanguaShrink 在保持语义相似性的同时,实现了高达 26 倍的压缩。与现有的提示压缩方法相比,LanguaShrink 将端到端延迟提升了 1.43 倍。

关键词

引用

@article{arxiv.2409.00855,
  title  = {LanguaShrink: Reducing Token Overhead with Psycholinguistics},
  author = {Xuechen Liang and Meiling Tao and Yinghui Xia and Tianyu Shi and Jun Wang and JingSong Yang},
  journal= {arXiv preprint arXiv:2409.00855},
  year   = {2024}
}