中文

评估应用场景中的 RAG 指标:一项实验、其发现及其局限性

计算与语言 2026-07-08 v1

摘要

本文报告了一项评估若干 RAG 指标相关性的实证研究。该实验基于一个由人类标注者从业务数据创建的问答案例集。使用来自四个库的评估指标对 RAG 系统生成的回答和检索到的片段进行评分。将这些指标与两位评估者的评分以及召回率等标准指标进行比较。进行了相关性分析。最后,我们指出了我们方法论的某些局限性,将其与文献中使用的方法进行比较,并为未来研究提出了一些方向。本文是一篇最初发表在法语研讨会 EvalLLM 上的论文的英文翻译。

关键词

引用

@article{arxiv.2607.07302,
  title  = {Evaluating RAG Metrics in Applied Contexts: An Experiment, Its Findings and Its Limitations},
  author = {Quentin Brabant},
  journal= {arXiv preprint arXiv:2607.07302},
  year   = {2026}
}