DoGMaTiQ:面向报告评估的问答信息块自动生成
计算与语言
2026-05-07 v1 信息检索
摘要
由于检索增强生成(RAG)系统的大规模采用,对长篇、带引用报告的评估近来受到了广泛关注。许多评估框架的核心是使用原子事实或信息块来评估报告对底层集合中证明的查询相关信息的覆盖程度。虽然信息块传统上被表示为简短陈述,但最近的工作使用了问答(QA)表示,实现了将信息需求(即问题)与满足其的潜在多样内容(即答案)解耦的细粒度评估。基于信息块评估的一个持续挑战是需要为测试集合中的每个主题手动策划信息块集——这是一个难以扩展到新信息需求的费力过程。这一挑战在跨语言设置中尤为严峻,因为信息存在于多语言源文档中。因此,我们引入了 DoGMaTiQ,这是一个分三个阶段生成高质量基于 QA 的信息块集的流水线:(1) 基于文档的信息块生成,(2) 释义聚类,以及 (3) 基于原则性质量标准的信息块子选择。我们将 DoGMaTiQ 信息块与 AutoArgue——一个最近的基于信息块的评估框架——集成,以实现生成报告的完全自动评估。我们在两个跨语言 TREC 共享任务 NeuCLIR 和 RAGTIME 上进行了广泛实验,显示出与人在环和完全手动判断的强排名相关性。最后,对我们流水线的详细分析表明,强大的 LLM 信息块生成器是关键,并且由 DoGMaTiQ 诱导的系统排名对异常值系统具有鲁棒性。我们在 https://github.com/manestay/dogmatiq 上公开发布我们的代码和制品,以促进报告评估的未来研究。
引用
@article{arxiv.2605.04458,
title = {DoGMaTiQ: Automated Generation of Question-and-Answer Nuggets for Report Evaluation},
author = {Bryan Li and William Walden and Yu Hou and Gabrielle Kaili-May Liu and Dawn Lawrie and Jame Mayfield and Eugene Yang and Chris Callison-Burch and Laura Dietz},
journal= {arXiv preprint arXiv:2605.04458},
year = {2026}
}