中文

面向严格评估的RAG系统:due diligence的挑战

人工智能 2025-07-30 v1 应用统计

摘要

生成式AI的兴起推动了医疗和金融等高风险领域的显著进展。检索增强生成(RAG)架构尤为突出,因其能够从文档语料库中生成响应。尽管具有巨大潜力,但RAG系统在关键情境下的可靠性仍是 Concern,存在幻觉等问题。本研究评估了一个用于投资基金尽职调查的RAG系统。我们提出一种健全的评估协议,结合人工标注和LLM-Judge标注,以识别系统故障,如幻觉、偏题、引用失败和放弃。灵感来自预测驱动推断(PPI)方法,我们以统计保证实现精确的性能测量。我们提供了全面的数据集以供进一步分析。我们的贡献旨在增强工业应用中RAG系统评估协议的可靠性和可扩展性。

关键词

引用

@article{arxiv.2507.21753,
  title  = {Towards a rigorous evaluation of RAG systems: the challenge of due diligence},
  author = {Grégoire Martinon and Alexandra Lorenzo de Brionne and Jérôme Bohard and Antoine Lojou and Damien Hervault and Nicolas J-B. Brunel},
  journal= {arXiv preprint arXiv:2507.21753},
  year   = {2025}
}

备注

in French language. EvalLLM2025: Workshop on Evaluation Generative Models (LLM) and Challenges, AMIAD, 2025, Marseille, France