推理中继:评估大型语言模型在数学推理中的稳定性与可替换性
人工智能
2025-12-25 v1
摘要
链式思维(CoT)提示方法显著提高了大型语言模型(LLM)的推理能力。虽然先前的工作侧重于通过内部推理策略来提高模型性能,但关于推理在不同模型之间的可替换性几乎没有研究。本文我们探讨了来自一个模型的部分完成的推理链能否被另一个模型可靠地续写,这既适用于同一模型家族内部,也适用于跨模型家族。我们通过评估中间推理痕迹作为逻辑一致性和最终答案准确性可转移支架的充分性来实现这一目标。我们将这种可替换性解释为检查推理稳定性的一种方式,探讨在模型替换下,推理是否仍然保持连贯性和可靠性。我们使用基于token级对数概率阈值的截断方法,从我们的基线模型Gemma-3-4B-IT和LLaMA-3.1-70B-Instruct中,在早期、中期和后期阶段进行截断,并用Gemma-3-1B-IT和LLaMA-3.1-8B-Instruct进行续写实验,以测试同一模型家族内部和跨模型家族的行为。我们的评估管道利用截断阈值配合过程奖励模型(PRM),提供了一个可复现的框架,用于通过模型互换来评估推理稳定性。使用PRM进行的评估显示,混合推理链往往保持甚至在某些情况下提高最终准确性和逻辑结构。我们的发现表明,可替换性是推理模型的一种新兴行为属性,为可靠模块化推理在协作式AI系统中提供了新的洞见。
引用
@article{arxiv.2512.20647,
title = {Reasoning Relay: Evaluating Stability and Interchangeability of Large Language Models in Mathematical Reasoning},
author = {Leo Lu and Jonathan Zhang and Sean Chua and Spencer Kim and Kevin Zhu and Sean O'Brien and Vasu Sharma},
journal= {arXiv preprint arXiv:2512.20647},
year = {2025}
}
备注
NeurIPS 2025 Workshop on Socially Responsible and Trustworthy Foundation Models (ResponsibleFM)