中文

EncouRAGe:评估RAG系统的局部、快速与可靠性

计算与语言 2025-11-10 v1 人工智能 信息检索

摘要

我们提出EncouRAGe,一个综合性的Python框架,旨在简化使用大语言模型(LLM)和嵌入模型开发和评估检索增强生成(RAG)系统的流程。EncouRAGe包含五个模块化和可扩展组件:类型清单、RAG工厂、推理、向量存储和指标,促进灵活的实验和可扩展开发。该框架强调科学可重复性、多样化评估指标和本地部署,使研究人员能够高效评估RAG工作流程中的数据集。本文提供实现细节并对多个基准数据集进行广泛评估,包括25k个问答对和5.1万文档。我们的结果表明,RAG在各个数据集上仍不及Oracle Context,而混合BM25在所有四个数据集中表现最佳。我们进一步检查了重排序的效果,发现仅带来有限的性能提升,同时伴随更高的响应延迟。

关键词

引用

@article{arxiv.2511.04696,
  title  = {EncouRAGe: Evaluating RAG Local, Fast, and Reliable},
  author = {Jan Strich and Adeline Scharfenberg and Chris Biemann and Martin Semmann},
  journal= {arXiv preprint arXiv:2511.04696},
  year   = {2025}
}

备注

Currently under review