中文

从冗长到精简:基于多轮细化与性能感知的自适应思维链压缩

计算与语言 2025-09-29 v1 人工智能

摘要

思维链推理提升了模型在复杂任务上的表现,但由于其冗长性引入了显著的推理延迟。我们提出了多轮自适应思维链压缩,这是一个利用 token 弹性现象——即过小的 token 预算反而会反常地增加输出长度——通过多轮细化逐步压缩 CoT 的框架。这种自适应策略允许 MACC 为每个输入确定最佳压缩深度。我们的方法在最先进的基线上实现了平均 5.6% 的准确率提升,同时将 CoT 长度平均减少了 47 个 token,并显著降低了延迟。此外,我们表明测试时的性能——准确率和 token 长度——可以使用训练集上的困惑度和压缩率等可解释特征进行可靠预测。在不同模型上的评估表明,我们的方法无需重复微调即可实现高效的模型选择和预测,证明了 CoT 压缩既有效又可预测。我们的代码将在 https://github.com/Leon221220/MACC 发布。

关键词

引用

@article{arxiv.2509.22144,
  title  = {From Long to Lean: Performance-aware and Adaptive Chain-of-Thought Compression via Multi-round Refinement},
  author = {Jianzhi Yan and Le Liu and Youcheng Pan and Shiwei Chen and Zike Yuan and Yang Xiang and Buzhou Tang},
  journal= {arXiv preprint arXiv:2509.22144},
  year   = {2025}
}

备注

17 pages, 8 figures