利用 RAG 增强 LLM 事实准确性以对抗幻觉:私有知识库中特定领域查询的案例研究
计算与语言
2024-03-18 v1 机器学习
摘要
我们提出了一种端到端系统设计,旨在利用检索增强生成(RAG)来提高大型语言模型(LLM)在涉及私有知识库的特定领域和时间敏感查询中的事实准确性。我们的系统将 RAG 流水线与上游数据集处理和下游性能评估相集成。针对 LLM 幻觉的挑战,我们使用来自 CMU 丰富资源并由教师模型标注的精选数据集对模型进行微调。我们的实验表明,该系统在为特定领域和时间敏感的查询生成更准确的答案方面是有效的。结果还揭示了使用小规模和偏斜数据集微调 LLM 的局限性。本研究突出了 RAG 系统在利用外部数据集增强 LLM 以提升知识密集型任务性能方面的潜力。我们的代码和模型可在 Github 上获取。
引用
@article{arxiv.2403.10446,
title = {Enhancing LLM Factual Accuracy with RAG to Counter Hallucinations: A Case Study on Domain-Specific Queries in Private Knowledge-Bases},
author = {Jiarui Li and Ye Yuan and Zehua Zhang},
journal= {arXiv preprint arXiv:2403.10446},
year = {2024}
}
备注
These authors contributed equally to this work