OS-Pruner:通过最优停止修剪推理模型的思维链
人工智能
2026-07-13 v1
摘要
大型语言模型(LLM)通过思维链(CoT)提示在复杂推理任务中取得了显著成功。然而,这些模型经常表现出“计算过度思考”,生成冗余的推理步骤,增加了延迟和成本,却没有提高准确性。最近的研究表明,CoT轨迹可以被显著修剪,但现有方法通常依赖于强制静态思考预算、启发式过滤、通过分类进行次优提前退出,或昂贵的重新训练。在本文中,我们介绍了OS-Pruner,一个轻量级插件框架,将思维链修剪表述为一个最优停止问题。给定一个推理前缀,OS-Pruner通过优化一个显式效用函数来学习进一步推理是否值得其令牌成本,该效用函数权衡最终答案准确性与生成长度。我们新颖的公式使模型能够动态评估推理链的充分终止点。OS-Pruner旨在训练和推理期间都保持轻量级,并为用户提供对推理努力与准确性权衡的细粒度控制。在多样化的推理基准和基础模型上,OS-Pruner实现了20-60%的生成长度减少,同时准确性损失极小。
引用
@article{arxiv.2607.11089,
title = {OS-Pruner: Pruning Chains-of-Thought of Reasoning Models via Optimal Stopping},
author = {Mohammed Ehab and Aymane El Gadarri and Vivek F. Farias and Adam Jozefiak and Ciamac C. Moallemi},
journal= {arXiv preprint arXiv:2607.11089},
year = {2026}
}