中文

AuthTrace:诊断主题密集单作者语料库中的证据构建

计算与语言 2026-05-27 v2

摘要

证据构建——决定哪些段落在生成开始前到达语言模型的阶段——按范例进行评估,使实践者没有原则方法来诊断哪种组织策略失败、在何处失败、或为何失败。我们引入AuthTrace,一个基于主题密集单作者语料库构建的诊断基准,近似干扰项在风格、主题和词汇上与所需证据相似。AuthTrace提供显式引述证据、精确fan-in注释,以及衡量证据召回率、证据精确率和答案正确性的统一pack-level协议。fan-in梯度——支持答案所需的源文档数量——作为主要诊断轴,使检索、记忆、图和结构化证据等方法进行受控比较。评估八个系统,涵盖两个QA模型,我们发现证据召回率是答案正确性最强的观察预测器(r = 0.96);大多数失败源于缺失证据而非答案综合。fan-in进一步暴露了特定范式的崩溃模式:平坦检索在themically组织的证据构建速度快3-5倍。这些结果表明fan-in分解是识别证据构建系统故障位置和哪种范式最适合特定工作负载的可重用诊断镜头。

关键词

引用

@article{arxiv.2605.25382,
  title  = {AuthTrace: Diagnosing Evidence Construction in Thematically Dense Single-Author Corpora},
  author = {Xiaoqing Wu and Feifei Li and Haoliang Ming and Wenhui Que},
  journal= {arXiv preprint arXiv:2605.25382},
  year   = {2026}
}