中文

探究检索增强生成与微调在 AI 驱动知识库系统开发中的性能

计算与语言 2025-05-13 v1 人工智能 机器学习

摘要

生成式大语言模型(Generative Large Language Models, G-LLM)的研发开辟了类似 ChatGPT、Bing、Gemini 等新型知识库系统的开发新机遇。微调(Fine-tuning, FN)和检索增强生成(Retrieval-Augmented Generation, RAG)是可用于实现 G-LLM 域适应的技术。在本研究中,我们使用 ROUGE、BLEU、METEOR 分数以及余弦相似度,对比检验了 RAG 与 FN 在 GPT-J-6B、OPT-6.7B、LlaMA、LlaMA-2 等语言模型上的性能。基于不同数据集上的测量结果,我们展示了 RAG 基于构建的效率优于采用 FN 的模型。我们指出,将 FN 模型与 RAG 连接并不直接,因为将 FN 模型与 RAG 连接可能导致性能下降。此外,我们概述了一种简单的 RAG 基于架构,平均而言,相较于 FN 模型在 ROGUE 分数上高出 16%,BLEU 分数上提升 15%,基于余弦相似度提升 53%。这表明了 RAG 在减少幻觉方面的显著优势,而 FN 模型平均提升 8% 的 METEOR 分数虽表现出更大的创造性,但无法弥补 RAG 在这方面的劣势。

关键词

引用

@article{arxiv.2403.09727,
  title  = {Investigating the performance of Retrieval-Augmented Generation and fine-tuning for the development of AI-driven knowledge-based systems},
  author = {Robert Lakatos and Peter Pollner and Andras Hajdu and Tamas Joo},
  journal= {arXiv preprint arXiv:2403.09727},
  year   = {2025}
}