中文

基于RAG的问答中LLM性能比较:计算机科学文献中的案例研究

计算与语言 2025-11-06 v1 人工智能

摘要

检索增强生成 (RAG) 正日益成为一种强大的技术,用于通过减少幻觉来增强生成式 AI 模型的能力。因此,RAG 的日益突出以及大型语言模型 (LLM) 的不断涌现,催生了对不同 LLM 在问答 (QA) 任务中性能进行比较的兴趣,这种比较在不同领域都适用。本研究比较了四个开源 LLM(Mistral-7b-instruct、LLaMa2-7b-chat、Falcon-7b-instruct 和 Orca-mini-v3-7b)以及 OpenAI 的流行 GPT-3.5 在计算机科学文献中利用 RAG 支持进行 QA 任务中的性能。本研究所采用的评估指标包括用于二元问题的准确率和精确率,以及由人类专家排序、由 Google AI 模型 Gemini 排序,以及用于长答案问题的余弦相似度。GPT-3.5 配合 RAG 能够有效回答二元和长答案问题,重新确认了其作为先进 LLM 的地位。就开源 LLM 而言,Mistral AI 的 Mistral-7b-instruct 配合 RAG 在回答二元和长答案问题方面遥遥领先。然而,在开源 LLM 中,Orca-mini-v3-7b 在生成响应方面报告了最短的平均延迟,而 Meta 的 LLaMa2-7b-chat 报告了最高的平均延迟。这项研究进一步强调,开源 LLM 同样可以与像 GPT-3.5 这样的专有模型搭配使用,后者在更好的基础设施支持下表现更佳。

关键词

引用

@article{arxiv.2511.03261,
  title  = {Comparing the Performance of LLMs in RAG-based Question-Answering: A Case Study in Computer Science Literature},
  author = {Ranul Dayarathne and Uvini Ranaweera and Upeksha Ganegoda},
  journal= {arXiv preprint arXiv:2511.03261},
  year   = {2025}
}

备注

18 pages, 4 figures, 5 tables, presented at the 5th International Conference on Artificial Intelligence in Education Technology