CRAG -- 全面RAG基准
计算与语言
2024-11-04 v2
摘要
检索增强生成(RAG)最近作为缓解大语言模型(LLM)知识不足的解决方案而引起广泛关注。然而,现有RAG数据集未能充分代表现实问答任务中呈现出的多样性和动态性。为弥合这一差距,我们提出了综合性RAG基准(CRAG),这是一套包含4,409组问答对的事实性问答基准,配有模拟Web搜索和知识图谱(KG)搜索的mock API。CRAG旨�涵盖五个领域、八个问答类别中的多样化问题,涵盖从流行到长尾实体的不同受欢迎程度,以及从年份到秒级的时序动态变化。我们的评估结果表明,当前基准仍存在信任QA的不足问题。虽然大多数先进LLM在CRAG上仅实现≤34%的准确率,但以直接方式添加RAG仅将准确率提升至44%。行业最先进的RAG解决方案仅能在无任何幻觉的情况下回答63%的问题。CRAG还揭示了在回答涉及更高动态性、较低受欢迎程度或更高复杂度事实的问题时,准确率显著降低,这为未来的研究方向提供了线索。CRAG基准为KDD Cup 2024挑战奠定了基础,吸引了大量参赛者和提交作品。我们承诺持续维护CRAG,为推动RAG解决方案及通用QA解决方案的发展服务于研究社区。CRAG已公开于https://github.com/facebookresearch/CRAG/。
引用
@article{arxiv.2406.04744,
title = {CRAG -- Comprehensive RAG Benchmark},
author = {Xiao Yang and Kai Sun and Hao Xin and Yushi Sun and Nikita Bhalla and Xiangsen Chen and Sajal Choudhary and Rongze Daniel Gui and Ziran Will Jiang and Ziyu Jiang and Lingkun Kong and Brian Moran and Jiaqi Wang and Yifan Ethan Xu and An Yan and Chenyu Yang and Eting Yuan and Hanwen Zha and Nan Tang and Lei Chen and Nicolas Scheffer and Yue Liu and Nirav Shah and Rakesh Wanga and Anuj Kumar and Wen-tau Yih and Xin Luna Dong},
journal= {arXiv preprint arXiv:2406.04744},
year = {2024}
}
备注
NeurIPS 2024 Datasets and Benchmarks Track