中文

基于显著性驱动的大语言模型动态标记裁剪

计算与语言 2025-04-10 v2 人工智能

摘要

尽管近期大语言模型 (LLMs) 取得了显著进展,但在长序列推理场景中仍面临挑战,因为注意力机制的二次计算复杂度。鼓舞于神经网络模型中特征归因可解释性理论,我们观察到并非所有标记都具有相同的贡献。基于此,我们提出一种新颖的标记裁剪框架,称为显著性驱动动态标记裁剪 (Saliency-driven Dynamic Token Pruning, SDTP),以输入语境为基础逐步和动态地裁剪冗余标记。具体而言,设计了一个轻量级的显著性驱动预测模块,用于估计每个标记的重要性得分,其隐藏状态被添加到 LLM 的不同层中,以分层方式裁剪冗余标记。进一步提出一种基于排序的优化策略,以最小化显著性得分与预测重要性得分之间的排序偏差。大量实验表明,该框架可被广泛应用于各种模型和数据集。通过分层裁剪 65% 的输入标记,我们的方法在推理时大幅降低 33%~47% 的 FLOPs,加速最高可达 1.75 倍,同时保持可 comparable 的性能。我们进一步演示了 SDTP 可与 KV 缓存压缩方法结合以实现进一步压缩。

关键词

引用

@article{arxiv.2504.04514,
  title  = {Saliency-driven Dynamic Token Pruning for Large Language Models},
  author = {Yao Tao and Yehui Tang and Yun Wang and Mingjian Zhu and Hailin Hu and Yunhe Wang},
  journal= {arXiv preprint arXiv:2504.04514},
  year   = {2025}
}