中文

理解审计:语言模型数学推理的后验约束推理

计算与语言 2025-10-21 v2 人工智能

摘要

大型语言模型(LLM)通常生成看似连贯但基于未经支持的假设的推理轨迹,导致产生幻觉结论。先前的工作主要处理事实性幻觉或依赖事后验证,而由推理引发的幻觉在很大程度上仍未得到解决。我们提出理解审计(AoU),这是一个通过三个阶段将推理约束到经过验证的前提的框架:(1)将查询分解为候选假设,(2)审计其支持度,以及(3)仅基于验证过的子集进行推理。形式上,AoU是后验约束推理,与选择性预测和拒绝学习相关联。我们的贡献有三方面:(i)在完美验证下的理论保证,(ii)在不完美审计下的超额风险界,以及(iii)可处理性分析。实验上,AoU在GSM8K、MultiArith和SVAMP上提高了准确性和忠实度,在GSM8K上实现了高达+30%的提升,在MultiArith上实现了+45%的提升,在SVAMP上相对于思维链、自一致性和CoT解码实现了持续的+20-28%的提升。代码可在https://anonymous.4open.science/r/audit-of-understanding-E28B获取。

关键词

引用

@article{arxiv.2510.10252,
  title  = {Audit-of-Understanding: Posterior-Constrained Inference for Mathematical Reasoning in Language Models},
  author = {Samir Abdaljalil and Erchin Serpedin and Khalid Qaraqe and Hasan Kurban},
  journal= {arXiv preprint arXiv:2510.10252},
  year   = {2025}
}