Accordion-Thinking:高效且可读的 LLM 推理的自调节步骤概述
人工智能
2026-04-10 v2 机器学习
摘要
通过延长 Chain-of-Thought 实现推理能力的扩展带来显著提升,然而由于 KV 缓存线性增长和注意力复杂度呈二次方增长,这一方法面临实际限制。在本文中,我们引入了 Accordion-Thinking,一个端到端框架,使 LLM 能够通过动态概述自我调节推理步骤的细节程度。这种机制使 Fold 推理模式成为可能,该模式定期对模型进行思维过程的概述并丢弃过去的思维,以减少对历史标记的依赖。我们应用强化学习来激励这种能力,发现一个关键洞察:Fold 模式与 exhaustive Unfold 模式之间的准确率差距随着训练的进行逐渐缩小,最终消失。这一现象表明,模型学习将关键推理信息编码到紧凑的概述中,从而实现对推理上下文的有效压缩。我们的 Accordion-Thinking 表明,经过学习的自压缩后,LLM 可以在不损害解决方案质量的前提下,以最小的依赖标记开销来处理复杂推理任务,并且在 48GB GPU 内存配置下实现了三倍的吞吐量,而结构化的步骤概述为推理过程的人类可读账户。
引用
@article{arxiv.2602.03249,
title = {Accordion-Thinking: Self-Regulated Step Summaries for Efficient and Readable LLM Reasoning},
author = {Zhicheng Yang and Zhijiang Guo and Yinya Huang and Yongxin Wang and Wenlei Shi and Yiwei Wang and Xiaodan Liang and Jing Tang},
journal= {arXiv preprint arXiv:2602.03249},
year = {2026}
}