实用 RAG 评估: 稀有感知集合基准度量与成本-延迟-质量权衡
信息检索
2025-11-13 v1
摘要
本文聚焦于构建生产级检索增强生成 (RAG) 系统中的核心挑战。经典的基于排序的信息检索指标(如 nDCG/MAP/MRR)不适用于 RAG,因为大语言模型 (LLM) 消耗的是一组篇章而非浏览列表;位置贴现与盲目聚合忽略了关键问题:在截断值 K 处的提示是否包含决定性证据。其次,缺乏标准化、可复现的黄金集构建与审计方式;其次,已有排行榜但缺乏端到端、基于语料库的基准测试,无法反映生产环境中的权衡;其次,最新嵌入模型如何处理proper-name 身份信号和对话式噪声仍不为人所知。为此,我们贡献了以下内容:(1) RA-nWG@K,一种稀有感知、按查询归一化的集合评分方法,以及通过池 restricted oracle ceiling (PROC) 和百分比 PROC (%PROC) 将检索与排序头寸分离,同时以成本-延迟-质量 (CLQ) 的视角进行操作;(2) rag-gs (MIT),一个精简的黄金集管道,采用 Plackett-Luce 列表级细化,其迭代更新优于单次 LLM 排序;(3) 在生产级 RAG (科学论文语料库) 上的全面基准测试,涵盖稠密检索、混合稠密+BM25、嵌入模型与维度、交叉编码 reranker、ANN (HNSW) 以及量化技术;以及 (4) 一组针对性诊断工具,量化 proper-name 身份信号和对话式噪声敏感性,通过 identity-destroying 和格式化 ablation 进行测量。综上,这些组件为实践者提供了Pareto 导向的指导,并构建可审计的防护栏,支持可复现、预算感知且符合服务等级协议 (SLA) 的决策。
关键词
引用
@article{arxiv.2511.09545,
title = {Practical RAG Evaluation: A Rarity-Aware Set-Based Metric and Cost-Latency-Quality Trade-offs},
author = {Etienne Dallaire},
journal= {arXiv preprint arXiv:2511.09545},
year = {2025}
}