SurveyBench:LLM(智能体)是否能够写出符合读者需求的学术综述?
计算与语言
2025-10-07 v2
摘要
学术综述需要将庞大的文献浓缩为连贯且富有洞察力的叙述,这是一项耗时且需要高度智力的工作。虽然近期方法,如通用 DeepResearch 智能体和综述专用方法,能够自动生成综述(即 LLM4Survey),但其输出往往不足以达到人类水平,且缺乏严格的、面向读者的基准来彻底揭示其不足之处。为填补这一空白,我们提出了 SurveyBench 框架,采用细粒度、测验驱动的评估方法,包含(1)来自最近 11,343 篇 arXiv 论文及其对应 4,947 篇高质量综述的典型综述主题;(2)多维度指标体系,评估提纲质量(如覆盖广度、逻辑连贯性)、内容质量(如综合细粒度、洞察清晰度)以及非文本丰富性;(3)双模式评估协议,包括基于内容的和测验基准的可答性测试,明确对齐读者的信访需求。结果表明,SurveyBench 有效挑战现有 LLM4Survey 方法(例如在基于内容的评估中平均低于人类 21%)。
引用
@article{arxiv.2510.03120,
title = {SurveyBench: Can LLM(-Agents) Write Academic Surveys that Align with Reader Needs?},
author = {Zhaojun Sun and Xuzhou Zhu and Xuanhe Zhou and Xin Tong and Shuo Wang and Jie Fu and Guoliang Li and Zhiyuan Liu and Fan Wu},
journal= {arXiv preprint arXiv:2510.03120},
year = {2025}
}
备注
Visit our code repository at: https://github.com/weAIDB/SurveyBench