中文

深层研究,浅层评估:关于长形式 QA 基准的元评估案例研究

计算与语言 2026-03-10 v1

摘要

近期进展使能够生成长篇报告的系统大幅普及。这促使使用 LLM-as-judge 协议和 claim verification 评估框架,以及寻求验证这些方法的元评估框架。许多元评估通过比较其评估与人类两两偏好的估计来衡量评估质量。然而,先前的工作表明,人类两两偏好可能过于简洁,无法捕捉专家期望的细微差别。我们针对长形式 QA 基准进行元评估案例研究,使用 ScholarQA-CS2,该基准旨在评估科学领域中基于检索的深层研究 QA。我们通过人类两两偏好判断全面验证了该基准,然后批判性地检阅了这种方法的优势、劣势及潜在干扰因素。我们表明,两两偏好排名最适合用于系统层面的评估,而显式的指标级注释和专家标注员对可靠的指标级评估至关重要,主观性仍是关键挑战。基于我们的发现,我们提出实用指南,以 better 对齐评估方法、标注员专业知识和报告实践,为设计未来元评估提供指导。通过揭示这些方法论挑战,我们旨在推动深层研究系统的评估标准。

关键词

引用

@article{arxiv.2603.06942,
  title  = {Deep Research, Shallow Evaluation: A Case Study in Meta-Evaluation for Long-Form QA Benchmarks},
  author = {Jena D. Hwang and Varsha Kishore and Amanpreet Singh and Dany Haddad and Aakanksha Naik and Malachi Hamada and Jonathan Bragg and Mike D'Arcy and Daniel S. Weld and Lucy Lu Wang and Doug Downey and Sergey Feldman},
  journal= {arXiv preprint arXiv:2603.06942},
  year   = {2026}
}

备注

11 pages (including Limitations), 10 figures, 9 tables