EntroCut:基于熵引导的自适应链式思考在小规模大推理模型中的高效截断方法
人工智能
2026-02-02 v1
摘要
大型推理模型(LRMs)通过扩展链式思维生成在复杂推理任务中表现突出,但其对冗长中间步骤的依赖导致计算成本高昂。我们发现,模型输出分布熵在早期推理步骤中可靠地区分正确与错误的推理。基于此观察,我们提出EntroCut,这是一种训练-free方法,通过识别高置信度状态动态截断推理,以安全终止推理。为全面评估效率与准确性之间的权衡,我们引入效率-绩效比(EPR)这一统一指标,用于量化单位准确性损失下的token节省比例。在四个基准测试上实验表明,EntroCut可减少最高40%的token使用,几乎不损失准确性,实现了在现有训练-free方法与其之间的卓越效率-绩效权衡。这些结果表明,熵引导的动态截断为缓解LRMs的低效问题提供了实用方法。
引用
@article{arxiv.2601.22617,
title = {EntroCut: Entropy-Guided Adaptive Truncation for Efficient Chain-of-Thought Reasoning in Small-scale Large Reasoning Models},
author = {Hongxi Yan and Qingjie Liu and Yunhong Wang},
journal= {arXiv preprint arXiv:2601.22617},
year = {2026}
}
备注
Accepted by ICASSP26