中文

SurveyEval:面向 LLM 生成学术综述的全面评估

计算与语言 2025-12-03 v1 人工智能

摘要

LLM 驱动的自动综述系统正在通过整合检索、组织和内容合成等功能,改变用户获取网络信息的方式。尽管近期工作聚焦于开发新的生成管道,但如何评估此类复杂系统仍是一个重大挑战。为此,我们引入 SurveyEval,一个全面的基准,横跨三个维度:整体质量、提纲连贯性和参考文献准确性。我们扩展了评估范围至 7 个学科,并通过引入人类参考来强化评估-人类对齐。评估结果表明,一般长文本或论文写作系统倾向于产生较低质量的综述,而专门的综述生成系统能够显著提升综述质量。我们设想 SurveyEval 作为理解和改进跨不同学科和评估标准的自动综述系统的可扩展测试平台。

关键词

引用

@article{arxiv.2512.02763,
  title  = {SurveyEval: Towards Comprehensive Evaluation of LLM-Generated Academic Surveys},
  author = {Jiahao Zhao and Shuaixing Zhang and Nan Xu and Lei Wang},
  journal= {arXiv preprint arXiv:2512.02763},
  year   = {2025}
}