中文

检索增强生成的不可回答性评估

计算与语言 2025-04-22 v3

摘要

现有的检索增强生成 (RAG) 系统评估框架聚焦于可回答的查询,却忽视了恰当拒绝不可回答请求的重要性。本文引入 UAEval4RAG,一个旨在评估 RAG 系统能否有效处理不可回答查询的框架。我们定义了包含六个不可回答类别的分类体系,UAEval4RAG 利用未回答率和可接受率指标,为任意给定知识库自动合成多样且具有挑战性的查询。我们使用各种 RAG 组件进行了实验,包括检索模型、重写方法、重排序器、语言模型和提示策略,揭示了 RAG 系统性能中隐藏的权衡。我们的发现强调了组件选择与提示设计在优化 RAG 系统中的关键作用,以平衡可回答查询的准确率与不可回答查询的高拒绝率。UAEval4RAG 为开发更鲁棒、更可靠的 RAG 系统提供了有价值的见解与工具。

关键词

引用

@article{arxiv.2412.12300,
  title  = {Unanswerability Evaluation for Retrieval Augmented Generation},
  author = {Xiangyu Peng and Prafulla Kumar Choubey and Caiming Xiong and Chien-Sheng Wu},
  journal= {arXiv preprint arXiv:2412.12300},
  year   = {2025}
}