ReProbe:通过探测大语言模型内部状态实现多步推理的高效测试时扩展
人工智能
2026-04-24 v5 计算与语言
摘要
大语言模型(LLM)可以通过生成长的、多步骤的推理链来解决复杂任务。测试时扩展(TTS)可以通过抽取多个中间推理步骤的变体、验证其正确性并选取最佳步骤来进一步提高性能。然而,现有的验证方法,如过程奖励模型(PRMs),计算成本高昂且需要大规模的人类或模型生成标注。我们提出了一种基于探测大语言模型内部状态的轻量级替代方案,用于推理步骤的级别验证。在训练一个基于转换器的探测器后,该探测器使用冻结的大语言模型的内部状态来估计其生成过程中推理步骤的可信度。标注可以由更大的大语言模型(如 DeepSeek-R1)提供,也可以以自监督方式由原始模型本身提供。由于探测器参数不足 1000 万,计算开销极小。在包括数学、规划和常识性问答在内的多个领域,我们的探测器的性能不仅匹配甚至超过最高可达 810 倍更大的 PRMs。这些结果表明,大语言模型的内部状态编码了其推理过程的置信度,可作为推理步骤验证的可靠信号,为实现可扩展、通用的 TTS 以及更具内省性的大语言模型提供了前景。
引用
@article{arxiv.2511.06209,
title = {ReProbe: Efficient Test-Time Scaling of Multi-Step Reasoning by Probing Internal States of Large Language Models},
author = {Jingwei Ni and Ekaterina Fadeeva and Tianyi Wu and Mubashara Akhtar and Jiaheng Zhang and Elliott Ash and Markus Leippold and Timothy Baldwin and See-Kiong Ng and Artem Shelmanov and Mrinmaya Sachan},
journal= {arXiv preprint arXiv:2511.06209},
year = {2026}
}
备注
ACL 2026 Main