简洁之道:避免在并行测试时过度思考
机器学习
2025-10-27 v1
摘要
我们展示了一种简单且反直觉的启发式方法——选择最短解决方案——在提升LLM预测性能方面效果显著。以往研究表明,平行测试时计算(即对多个解决方案进行采样并选择最佳方案)可进一步增强LLM的性能,但此类方法常需复杂评分,增加计算成本和复杂度。我们发现,选择最短答案的简单方法效果极佳。我们认为,观察到的有效性源于模型在两种不同 regime 中的运作:简洁、自信的常规 regime 以及充满不确定性的冗长过度思考 regime,我们的证据显示,过度思考 regime 开始显著的临界点。通过选择最短答案,此启发式方法优先从常规 regime 中进行采样。我们确认,这种方法在两个具有挑战性的基准测试中,与自我一致性等更复杂方法相当,同时显著降低计算开销。最短答案启发式相较于自我一致性实现了帕累积改进,适用于输出等价性不明确的任务。
引用
@article{arxiv.2510.21067,
title = {The Virtues of Brevity: Avoid Overthinking in Parallel Test-Time Reasoning},
author = {Raul Cavalcante Dinardi and Bruno Yamamoto and Anna Helena Reali Costa and Artur Jordao},
journal= {arXiv preprint arXiv:2510.21067},
year = {2025}
}
备注
Accepted at NeurIPS 2025 Workshop on Efficient Reasoning