基于隐式信息信号的推理时链式思考修剪
机器学习
2025-11-05 v2
摘要
大型语言模型(LLMs)在生成多个候选解答时能提高推理准确性,但标准方法如最佳-N(BoN)通过完全生成所有分支来获取高计算成本。自修剪最佳-N(ST-BoN)通过提前修剪不有希望的路径来缓解这一问题,但其对基于一致性的启发式方法的依赖是局限性,因为它不直接评估分支质量。我们提出KL调整修剪路径算法(KAPPA),这是一种推理时方法,将Kullback-Leibler发散、置信度和熵整合到原则性评分函数中以指导渐进式修剪。通过在探索中促进多样性并选择性地消除低评分分支,KAPPA在保持准确性的同时,显著减少了内存和token用量。在GSM8K和MATH500上的实验表明,KAPPA在较小模型中稳定性能,并相对于BoN实现了最高约60%的峰值内存减少和约90%的总token生成减少,同时对准确性影响最小。
引用
@article{arxiv.2511.00699,
title = {Inference-Time Chain-of-Thought Pruning with Latent Informativeness Signals},
author = {Sophie Li and Nicholas Huang and Nayan Saxena and Nina Luo and Vincent Lin and Kevin Zhu and Sunishchal Dev},
journal= {arXiv preprint arXiv:2511.00699},
year = {2025}
}
备注
Accepted by NeurIPS 2025 Workshop on Efficient Reasoning