中文

RAGXplain:从可解释评估到可操作指导的 RAG 管道

信息检索 2026-03-19 v2 人工智能

摘要

检索增强生成(RAG)系统将大型语言模型与外部知识结合,但大多数评估方法报告的聚合分数只能揭示管道低于预期,却无法说明低于哪里或为何。我们引入 RAGXplain,一个将性能指标转化为可操作指导的评估框架。RAGXplain 将评估结构化地围绕'Metric Diamond'展开,将用户输入、检索上下文、生成答案以及(如有)ground truth 通过六个诊断维度相连。它利用 LLM 推理生成自然语言的 failure-mode 解释和优先级干预。在五个 QA 基准测试上,应用 RAGXplain 的建议后,经过单次人工引导即可在多个指标上持续改进 RAG 管道性能。我们将 RAGXplain 作为开源软件发布,以支持可重复性和社区采纳。

关键词

引用

@article{arxiv.2505.13538,
  title  = {RAGXplain: From Explainable Evaluation to Actionable Guidance of RAG Pipelines},
  author = {Dvir Cohen and Tamir Houri and Lin Burg and Gilad Barkan},
  journal= {arXiv preprint arXiv:2505.13538},
  year   = {2026}
}