STOP:低数据 regime 下长程推理的结构化有策略剪枝
计算与语言
2026-05-14 v1
摘要
长链式思维(Long CoT)推理在多步骤问题上可提升性能,但也会引发过度思考:模型常生成低产出的推理,增加推理成本和延迟。这一不效率在低数据精细调优场景中尤为突出,因为实际应用会在有限监督下适配推理模型,无法依赖大规模教师蒸馏或重型测试时控制。为此,我们提出 STOP(Structured On-policy Pruning),一种用于分析和剪枝长程推理痕迹的有策略算法。STOP 从模型构建自蒸馏痕迹。随后将每个痕迹映射到结构化推理界面,通过节点分段、分类标注和推理树构建。基于此界面,我们引入 ECN(Earliest Correct Node),保留最短前缀,使其作为答案结论并产生正确的最终答案,删除冗余的事后解答推理,同时保持语义连续性。在 DeepSeek-R1-Distill-Qwen-7B 和 DeepSeek-R1-Distill-LLaMA-3-8B 上进行 GSM8K、Math 500 和 AIME 2024 上的实验表明,STOP 在低数据精细调优下将生成的 token 减少 19.4-42.4%,同时在保持准确率方面表现良好。除了效率之外,我们的分析表明,STOP 比教师引导的剪枝引起的分布性偏移更小,改进了生成推理的结构效率,并将推理资源从冗余验证和回溯重新分配到更具生产性的探索上。
引用
@article{arxiv.2605.13165,
title = {STOP: Structured On-Policy Pruning of Long-Form Reasoning in Low-Data Regimes},
author = {Chenjun Xu and Zhennan Zhou and Zhan Su and Bill Howe and Lucy Lu Wang and Bingbing Wen},
journal= {arXiv preprint arXiv:2605.13165},
year = {2026}
}
备注
20 pages, 6 figures, 6 tables. Code available at: https://github.com/chenjux/ECN-STOP