理解审计:语言模型数学推理的后验约束推理
计算与语言
2025-10-21 v2 人工智能
摘要
大型语言模型(LLM)通常生成看似连贯但基于未经支持的假设的推理轨迹,导致产生幻觉结论。先前的工作主要处理事实性幻觉或依赖事后验证,而由推理引发的幻觉在很大程度上仍未得到解决。我们提出理解审计(AoU),这是一个通过三个阶段将推理约束到经过验证的前提的框架:(1)将查询分解为候选假设,(2)审计其支持度,以及(3)仅基于验证过的子集进行推理。形式上,AoU是后验约束推理,与选择性预测和拒绝学习相关联。我们的贡献有三方面:(i)在完美验证下的理论保证,(ii)在不完美审计下的超额风险界,以及(iii)可处理性分析。实验上,AoU在GSM8K、MultiArith和SVAMP上提高了准确性和忠实度,在GSM8K上实现了高达+30%的提升,在MultiArith上实现了+45%的提升,在SVAMP上相对于思维链、自一致性和CoT解码实现了持续的+20-28%的提升。代码可在https://anonymous.4open.science/r/audit-of-understanding-E28B获取。
引用
@article{arxiv.2510.10252,
title = {Audit-of-Understanding: Posterior-Constrained Inference for Mathematical Reasoning in Language Models},
author = {Samir Abdaljalil and Erchin Serpedin and Khalid Qaraqe and Hasan Kurban},
journal= {arXiv preprint arXiv:2510.10252},
year = {2025}
}