大型语言模型中可解释数学的误差检测与纠正
人工智能
2025-08-06 v1
摘要
最近的大型语言模型(LLM)已展示出执行显式多步推理(如链式思维提示)的能力。然而,其中间步骤常包含可导致不准确最终预测的错误。此外,LLM 仍在困惑现象中挣扎,常未能遵守规定的输出格式,这在诸如生成数学表达式或源代码等任务中尤其棘手。本工作引入 EDCIM(Error Detection and Correction for Interpretable Mathematics,误差检测与纠正,用于可解释数学),用于检测可解释数学任务中的这些错误,后者要求模型生成精确的功能形式,以显式解答以自然语言表达的问题,而非黑箱解决方案。EDCIM 使用 LLM 为给定问题生成方程组,随后采用符号误差检测框架识别错误并为 LLM 基于纠正提供针对性反馈。为优化效率,EDCIM 将轻量级开源 LLM 与更强大的专有模型相结合,在成本和准确率之间进行权衡。这种平衡由单个超参数控制,允许用户根据成本和准确率要求进行权衡。跨不同数据集的实验结果表明,EDCIM 在显著降低计算和经济成本的同时,保持甚至在正确配置平衡时提高预测准确率。
引用
@article{arxiv.2508.03500,
title = {Error Detection and Correction for Interpretable Mathematics in Large Language Models},
author = {Yijin Yang and Cristina Cornelio and Mario Leiva and Paulo Shakarian},
journal= {arXiv preprint arXiv:2508.03500},
year = {2025}
}