伟大黄金回收:利用大语言模型自动化事实抽取与RAG评估
信息检索
2025-04-22 v1 计算与语言
摘要
大语言模型(LLM)显著提升了信息获取系统的能力,尤其是在检索增强生成(RAG)方面。然而,RAG系统的评估仍是阻碍进步的瓶颈,我们在此提出一种经人工标注验证的自动化评估框架。我们认为,黄金评估方法为评估RAG系统提供了坚实的基础。该方法最初于2003年的TREC问答轨道中开发,基于应出现于优质答案中的原子事实进行评估。我们的工作聚焦于“重构”这一方法,描述AutoNuggetizer框架,具体应用于LLM既自动创建黄金事实又自动分配黄金事实至系统答案。针对TREC 2024年RAG轨道,我们将完全自动化方法与人工或半自动创建黄金事实并手动分配给系统答案的策略进行校准。基于社区范围内的评估结果,我们观察到完全自动化黄金评估得分与人工方法在运行层面上具有高度一致性。这种一致性在各个框架组件(如黄金事实分配)独立自动化时更为强烈。这表明我们的评估框架在努力与质量之间提供了可供用于指导未来RAG系统开发的权衡。然而,仍需进一步研究以细化该方法,特别是在建立稳健的按主题一致性方面,以有效诊断系统故障。
引用
@article{arxiv.2504.15068,
title = {The Great Nugget Recall: Automating Fact Extraction and RAG Evaluation with Large Language Models},
author = {Ronak Pradeep and Nandan Thakur and Shivani Upadhyay and Daniel Campos and Nick Craswell and Jimmy Lin},
journal= {arXiv preprint arXiv:2504.15068},
year = {2025}
}
备注
To appear in SIGIR 2025. Significant updates and revisions to arXiv:2411.09607