中文

探测语言模型中的算术错误

计算与语言 2025-07-17 v1 人工智能

摘要

我们研究是否可以利用语言模型的内部激活来检测算术错误。从三位数加法的受控设置开始,我们表明,无论模型的输出是否正确,简单的探针都能从隐藏状态中准确解码模型预测的输出和正确答案。在此基础上,我们训练了轻量级的错误检测器,其对模型正确性的预测准确率超过90%。然后,我们将分析扩展到仅涉及加法的GSM8K问题上的结构化思维链轨迹,并发现基于简单算术训练的探针能够很好地泛化到这种更复杂的设置,揭示了其内部表示的一致性。最后,我们证明这些探针可以指导对错误推理步骤的选择性重新提示,从而在最小程度干扰正确输出的情况下提高任务准确率。我们的研究结果表明,仅凭内部激活就能预测算术错误,并且简单的探针为轻量级模型自我修正提供了一条可行路径。

关键词

引用

@article{arxiv.2507.12379,
  title  = {Probing for Arithmetic Errors in Language Models},
  author = {Yucheng Sun and Alessandro Stolfo and Mrinmaya Sachan},
  journal= {arXiv preprint arXiv:2507.12379},
  year   = {2025}
}