ResearchQA: 通过调查文章挖掘的问题答案评估,跨75个学科规模化评估学术问答
计算与语言
2025-12-22 v2 人工智能
摘要
评估针对研究查询的长形式响应严重依赖专家标注员,这限制了关注范围,如人工智能等领域 researcher 可以方便地招募同事。然而,research expertise十分充沛:调查文章将跨越文献的知识浓缩。我们引入ResearchQA,这是用于评估LLM系统的资源,通过从75个 research 领域的调查文章提炼出2.1万个查询和16万个 rubric 项目。查询和 rubric 项目均从调查章节中派生,其中 rubric 项目列出查询特定答案评估标准,即引用文献、制作解释和描述局限性。31名在8个领域获得博士学位的标注员判断,90%的查询反映博士信息需求,87%的 rubric 项目值得强调句子或更长。我们利用ResearchQA评估了18个系统进行7.6K场head-to-head比较。没有任何参数或检索增强系统达到70%的 rubric 覆盖率,最高排名系统显示75%的覆盖率。错误分析揭示,最高排名系统在完全覆盖引用 rubric 项目时不到11%,在48%的局限性项目中,和49%的比较项目中。我们公开了数据,以促进更全面的多领域评估。
引用
@article{arxiv.2509.00496,
title = {ResearchQA: Evaluating Scholarly Question Answering at Scale Across 75 Fields with Survey-Mined Questions and Rubrics},
author = {Li S. Yifei and Allen Chang and Chaitanya Malaviya and Mark Yatskar},
journal= {arXiv preprint arXiv:2509.00496},
year = {2025}
}
备注
12 pages main, 40 pages total, 15 figures