中文

Confident RAG:通过多嵌入和置信度评分提升大语言模型数学问答性能

计算与语言 2025-12-02 v3 人工智能

摘要

大语言模型(LLM)在数学教育方面具有巨大潜力,但它们常常难以进行复杂的数学推理。虽然检索增强生成(RAG)通过将LLM锚定在外部知识中来缓解这些问题,但其有效性仍然不稳定,严重依赖于单一嵌入模型的选择。超越静态的RAG工作流,我们借鉴了智能体工作流模式,这是一种引入结构化任务分解和协作以增强系统性能的范式。我们提出并研究了两种结合多个嵌入模型优势的新方法。虽然我们的混合嵌入RAG方法(融合检索到的文档)显示出有限的改进,但我们的Confident RAG方法(生成多个答案并选择置信度得分最高的一个)显示出显著的改进。实验结果表明,Confident RAG相对于原始LLM平均准确率提高了约10%,相对于原始RAG提高了约5%。在不同LLM和嵌入模型上的一致结果表明,Confident RAG是一种用于可信赖数学AI助手的高效即插即用解决方案。最后,我们讨论了这项工作如何为在教育环境中部署智能体RAG系统奠定基础,其中自主规划和迭代优化可以建立在我们稳健的检索基础之上。

关键词

引用

@article{arxiv.2507.17442,
  title  = {Confident RAG: Enhancing the Performance of LLMs for Mathematics Question Answering through Multi-Embedding and Confidence Scoring},
  author = {Shiting Chen and Zijian Zhao and Jinsong Chen},
  journal= {arXiv preprint arXiv:2507.17442},
  year   = {2025}
}