中文

基于首词惊讶度的高效 LLM 推理压缩

机器学习 2026-01-09 v2 软件工程

摘要

大规模推理模型(LRM)通过扩展链式思考(CoT)长度展示出惊人的能力,但过长的推理轨迹对训练成本和推理延迟构成了重大挑战。虽然各种 CoT 压缩方法涌现以应对这一挑战,但它们面临内在权衡:token 级方法常常破坏句法和逻辑一致性,而基于 perplexity 的步骤级方法因逻辑信息的稀释而难以可靠捕获逻辑关键推理步骤。本文提出了 ASAP(Anchor-guided, SurprisAl-based Pruning),一种新的粗到细框架用于 CoT 压缩。ASAP 首先进行锚点引导的剪枝,以保留核心推理结构,从而有效减少后续处理的搜索空间。利用逻辑分支选择集中在推理步骤起始处的洞见,随后通过选择基于新颖首词惊讶度指标的逻辑必需推理步骤来实现逻辑感知剪枝。最后,ASAP 在推理时间 distilled 这些简短 CoT,实现高效推理。实验表明,ASAP 在多个基准测试上实现了最先进的准确率,同时大幅降低了训练和推理成本。

关键词

引用

@article{arxiv.2508.05988,
  title  = {Pruning the Unsurprising: Efficient LLM Reasoning via First-Token Surprisal},
  author = {Wenhao Zeng and Yaoning Wang and Chao Hu and Yuling Shi and Chengcheng Wan and Hongyu Zhang and Xiaodong Gu},
  journal= {arXiv preprint arXiv:2508.05988},
  year   = {2026}
}

备注

Code and model available at https://github.com/Zengwh02/ASAP