剖析账本:在金融大语言模型中定位与抑制“说谎电路”
计算与语言
2025-12-01 v1 计算工程、金融与科学
摘要
大型语言模型(LLM)正在越来越多地部署于高风险金融领域,但在执行算术运算时会出现特定且可复现的幻觉。当前的缓解策略常将模型当作黑盒子处理。本文提出一种内在幻觉检测的机制方法。通过对 GPT-2 XL 架构在 ConvFinQA 数据集上应用因果追踪(Causal Tracing),我们识别出算术推理的双阶段机制:中间层(L12-L30)中的分布式计算草稿纸,以及后期层(具体为 Layer 46)中的决定性聚合电路。我们通过消融实验验证了该机制,表明抑制 Layer 46 可使模型对幻觉输出的置信度降低 81.8%。此外,我们证明了在该层上训练的线性探针可在 98% 的准确率下泛化到不可见的金融主题,暗示了算术欺骗的普遍几何结构。
引用
@article{arxiv.2511.21756,
title = {Dissecting the Ledger: Locating and Suppressing "Liar Circuits" in Financial Large Language Models},
author = {Soham Mirajkar},
journal= {arXiv preprint arXiv:2511.21756},
year = {2025}
}