中文

基于自洫性 hallucination 检测提升大语言模型数学推理能力

人工智能 2025-06-23 v3

摘要

大型语言模型 (LLM) 已显示出强大的数学推理能力,但在证明定理、符号操作和数值计算等场景仍易产生自洫性较强却不正确的陈述。虽然自洫性 (SC) 已被探索作为提升事实性的手段,但现有方法主要应用于最终答案选择,忽略了中间推理步骤的逻辑一致性。本文引入一种结构化自洫性框架,以增强数学推理的可靠性。我们的方法在中间步骤和最终输出之间强制执行自洫性,从而减少逻辑不一致和hallucination。我们在三个核心数学任务上进行评估:定理证明、符号转换和数值计算。实验结果表明,SC显著提高了证明的有效性、符号推理准确率和数值稳定性,同时保持计算效率。进一步分析表明,结构化自洫性不仅提升了问题解决准确率,也降低了模型生成输出的方差。这些发现表明,自洫性是提升大语言模型数学推理的稳健机制,为可靠、可解释的AI驱动数学学术发展铺平了道路。

关键词

引用

@article{arxiv.2504.09440,
  title  = {Enhancing Mathematical Reasoning in Large Language Models with Self-Consistency-Based Hallucination Detection},
  author = {MingShan Liu and Jialing Fang},
  journal= {arXiv preprint arXiv:2504.09440},
  year   = {2025}
}