SurGE:科学综述生成的基准测试与评估框架
计算与语言
2026-05-05 v5 人工智能
信息检索
摘要
学术文献的快速增长使得手动创建科学综述变得日益不可行。虽然大型语言模型在这一领域显示出广泛的前景,但由于缺乏标准化的基准测试和评估协议,相关进展受到制约。为弥合这一关键性空白,我们引入 SurGE(Survey Generation Evaluation),这是一个用于计算机科学领域科学综述生成的新型基准测试。SurGE 包含 (1) 一组测试实例,其中每个实例包括主题描述、专家编写的综述以及其完整的引用文献集合,和 (2) 一个规模为数十万篇的学术语料库。此外,我们提出了一套自动化评估框架,用于衡量生成综述在四个维度上的质量:全面性、引用准确性、结构组织和内容质量。我们对多样化的基于大语言模型的方法进行评估,发现其表现存在显著差距,表明即便是先进的智能体框架在综述生成的复杂性方面也难以应付,凸显了该领域未来研究的必要性。我们已在 https://github.com/oneal2000/SurGE 上开源所有代码、数据和模型。
引用
@article{arxiv.2508.15658,
title = {SurGE: A Benchmark and Evaluation Framework for Scientific Survey Generation},
author = {Weihang Su and Anzhe Xie and Qingyao Ai and Jianming Long and Xuanyi Chen and Jiaxin Mao and Ziyi Ye and Yiqun Liu},
journal= {arXiv preprint arXiv:2508.15658},
year = {2026}
}