中文

TokenSkip:大语言模型中可控链式思考压缩技术

计算与语言 2025-09-17 v3 人工智能

摘要

链式思考(Chain-of-Thought, CoT)已被证明在增强大语言模型(LLM)的推理能力方面非常有效。近期诸如 OpenAI 的 o1 和 DeepSeek-R1 等技术的进展表明,扩大 CoT 序列的推理长度可能进一步提升 LLM 的推理性能。然而,由于 LLM 解码的自回归特性,更长的 CoT 输出会导致推理延迟线性增长,尤其当 CoT 超过 10,000 个 token 时,对用户体验造成不利影响。为此,我们分析了 CoT 输出中 token 的语义重要性,发现其对推理的贡献存在差异。在此基础上,我们提出了 TokenSkip—a 一种简单且有效的方法,使 LLM 能够选择性地跳过不重要的 token,从而实现可控的 CoT 压缩。广泛的实验在各种模型和任务上表明,TokenSkip 在保持强大推理性能的同时,有效减少了 CoT token 的使用。值得注意的是,当应用于 Qwen2.5-14B-Instruct 时,TokenSkip 在 GSM8K 上的推理 token 减少 40%(从 313 个降至 181 个),性能下降不到 0.4%。我们将发布代码和模型权重至 https://github.com/hemingkx/TokenSkip。

关键词

引用

@article{arxiv.2502.12067,
  title  = {TokenSkip: Controllable Chain-of-Thought Compression in LLMs},
  author = {Heming Xia and Chak Tou Leong and Wenjie Wang and Yongqi Li and Wenjie Li},
  journal= {arXiv preprint arXiv:2502.12067},
  year   = {2025}
}

备注

EMNLP 2025 (Long Paper), camera-ready version