中文

IRSC:基于语义理解的检索增强生成场景零样本信息检索评估基准

信息检索 2024-09-27 v2 人工智能

摘要

在使用大型语言模型(LLM)的检索增强生成(RAG)任务中,检索信息的质量对最终输出至关重要。本文提出IRSC基准,用于评估嵌入模型在多语言RAG任务中的性能。该基准涵盖五类检索任务:查询检索、标题检索、段落片段检索、关键词检索和摘要检索。我们的研究针对当前RAG场景下嵌入模型缺乏全面测试和有效比较方法。我们引入了新的指标:语义理解指数相似性(SSCI)和检索能力竞赛指数(RCCI),并评估了Snowflake-Arctic、BGE、GTE和M3E等模型。我们的贡献包括:1) IRSC基准,2) SSCI和RCCI指标,3) 嵌入模型跨语言局限性见解。IRSC基准旨在增进对RAG任务中准确检索系统的理解与发展。所有代码和数据集均已公开:https://github.com/Jasaxion/IRSC_Benchmark

关键词

引用

@article{arxiv.2409.15763,
  title  = {IRSC: A Zero-shot Evaluation Benchmark for Information Retrieval through Semantic Comprehension in Retrieval-Augmented Generation Scenarios},
  author = {Hai Lin and Shaoxiong Zhan and Junyou Su and Haitao Zheng and Hui Wang},
  journal= {arXiv preprint arXiv:2409.15763},
  year   = {2024}
}