中文

基于 AutoNuggetizer 框架的 TREC 2024 RAG 轨道初始 Nugget 评估结果

信息检索 2024-11-15 v1 计算与语言

摘要

本报告提供了 TREC 2024 检索增强生成(RAG)轨道部分结果的初步概览。我们已将 RAG 评估确定为信息获取(以及更广泛的自然语言处理和人工智能)持续进步的障碍,希望能为解决该领域的诸多挑战做出贡献。本文探讨的核心假设是:最初为 TREC 2003 问答轨道开发的 nugget 评估方法,为评估 RAG 系统提供了坚实基础。因此,我们的工作重点在于“重构”这一方法,具体而言,利用大语言模型自动创建 nugget 并自动将 nugget 分配给系统答案。我们称之为 AutoNuggetizer 框架。在 TREC 设定下,我们能够将全自动流程与人工评估员半手动创建 nugget 并手动分配给系统答案的流程进行校准。基于来自 45 个运行的 21 个主题的初步结果,我们观察到全自动 nugget 评估得分与人工评估员(主要)手动 nugget 评估得分之间存在强相关性。这表明我们的全自动评估流程可用于指导 RAG 系统的未来迭代。

关键词

引用

@article{arxiv.2411.09607,
  title  = {Initial Nugget Evaluation Results for the TREC 2024 RAG Track with the AutoNuggetizer Framework},
  author = {Ronak Pradeep and Nandan Thakur and Shivani Upadhyay and Daniel Campos and Nick Craswell and Jimmy Lin},
  journal= {arXiv preprint arXiv:2411.09607},
  year   = {2024}
}