验证鸿沟:语言模型计算算术却无法验证的机制分析
计算与语言
2025-09-26 v2 人工智能
摘要
大型语言模型(LLM)验证其输出并识别潜在错误的能力对于确保鲁棒性和可靠性至关重要。然而,当前研究表明 LLM 在自我纠正方面存在困难,在检测错误时遇到重大挑战。虽然已有研究探索了增强 LLM 自我纠正的方法,但相对较少的关注被给予理解模型内部错误检测的机制。在本文中,我们对 LLM 中的错误检测进行了机制分析,重点关注简单的算术问题。通过电路分析,我们确定了四个较小规模 LLM 中负责检测算术错误的计算子图。我们的发现表明,所有模型都严重依赖于一致性头——即评估算术解中数值表面一致性的注意力头。此外,我们观察到模型内部的算术计算主要发生在较高层,而验证发生在中间层,在最终算术结果被完全编码之前。算术计算与验证之间的这种结构分离似乎解释了为什么较小规模的 LLM 甚至难以检测简单的算术错误。
引用
@article{arxiv.2502.11771,
title = {The Validation Gap: A Mechanistic Analysis of How Language Models Compute Arithmetic but Fail to Validate It},
author = {Leonardo Bertolazzi and Philipp Mondorf and Barbara Plank and Raffaella Bernardi},
journal= {arXiv preprint arXiv:2502.11771},
year = {2025}
}
备注
EMNLP 2025 Main, 38 pages, 33 figures