中文

超越最后答案:您的推理轨迹暴露了不止于此的东西

计算与语言 2025-04-30 v1 人工智能 机器学习

摘要

大语言模型(LLM)利用分步推理来解决复杂问题。标准评估实践是生成完整的推理轨迹并评估其结尾所呈现的最终答案的正确性。本文质疑仅依赖最终答案的做法,通过提出两个问题来检验:最终答案是否可靠地代表模型的最优结论?不同的推理路径是否会产生不同结果?为此,我们分析中间推理步骤(称为子思考),并提出一种基于发现的方法。该方法通过语言线索将推理轨迹分割为顺序的子思考。我们通过在每个中间子思考的终点处提示模型生成延续内容,从而从每个已完成的延续中提取潜在答案。我们发现,通过选择出现频率最高的答案(即众数)进行聚合,往往比仅依赖原始完整轨迹所得答案的准确率显著更高。分析不同子思考所得答案之间的一致性,揭示了这些答案与模型置信度和正确性之间的特征关联,表明有潜力用于识别较不可靠的答案。我们在 various LLMs 和具有挑战性的数学推理数据集(AIME2024 和 AIME2025)上的实验表明,此方法在各种模型上均实现了一致的准确率提升,提升幅度分别可达至 13% 和 10%。实现代码已公开:https://github.com/hammoudhasan/SubthoughtReasoner。

关键词

引用

@article{arxiv.2504.20708,
  title  = {Beyond the Last Answer: Your Reasoning Trace Uncovers More than You Think},
  author = {Hasan Abed Al Kader Hammoud and Hani Itani and Bernard Ghanem},
  journal= {arXiv preprint arXiv:2504.20708},
  year   = {2025}
}

备注

Preprint