中文

面向大语言模型的质量感知科学综述生成:SurveyGen

计算与语言 2025-08-26 v1 数字图书馆 信息检索

摘要

自动综述生成已成为科学文档处理中的关键任务。虽然大型语言模型(LLMs)在生成综述文本方面显示出前景,但缺乏标准化评估数据集严重削弱了其性能与人工撰写综述之间的严格评估。在本工作中,我们提出了 SurveyGen,一个由超过 4,200 篇跨越多个科学领域的人工撰写综述组成的大规模数据集,包含 242,143 条被引参考文献以及针对综述及被引论文的大量质量相关元数据。借助这一资源,我们构建了 QUAL-SG,一个新颖的质量感知综述生成框架,通过将质量感知指标纳入文献检索以评估和筛选高质量来源论文,增强了标准检索增强生成(RAG)管道的性能。使用该数据集和框架,我们系统评估了在不同人工参与程度下的最先进 LLMs——从完全自动生成到人工引导编写。实验结果和人类评估表明,虽然半自动管道可实现部分竞争性成果,但完全自动的综述生成仍存在引用质量低和批判性分析有限的问题。

关键词

引用

@article{arxiv.2508.17647,
  title  = {SurveyGen: Quality-Aware Scientific Survey Generation with Large Language Models},
  author = {Tong Bao and Mir Tafseer Nayeem and Davood Rafiei and Chengzhi Zhang},
  journal= {arXiv preprint arXiv:2508.17647},
  year   = {2025}
}