中文

SurveyForge:基于大纲启发式、记忆驱动生成与多维评估的自动化 survey 写作

计算与语言 2025-03-07 v1

摘要

调查性论文在科学研究中发挥着关键作用,尤其是近年来随着研究论文数量的快速增长。最近,研究者们开始使用大语言模型(LLM)来自动生成 survey 以提高效率。然而,与人类撰写的 survey 相比,LLM 生成的 survey 在大纲质量和引用准确性方面仍存在显著差距。为弥合这些差距,我们提出了 SurveyForge。该方法首先通过分析人类撰写大纲的逻辑结构并参考检索到的领域相关文献来生成大纲。随后,利用我们通过学者导航智能体从记忆中检索到的高质量文献,SurveyForge 能够自动生成和细化生成文章的内容。此外,为实现全面的评估,我们构建了 SurveyBench,包含 100 篇人类撰写的 survey 论文用于赢率比较,并对 AI 生成的 survey 论文从三个维度(参考文献、大纲和内容质量)进行评估。实验结果表明,SurveyForge 能优于 AutoSurvey 等以往方法。

关键词

引用

@article{arxiv.2503.04629,
  title  = {SurveyForge: On the Outline Heuristics, Memory-Driven Generation, and Multi-dimensional Evaluation for Automated Survey Writing},
  author = {Xiangchao Yan and Shiyang Feng and Jiakang Yuan and Renqiu Xia and Bin Wang and Bo Zhang and Lei Bai},
  journal= {arXiv preprint arXiv:2503.04629},
  year   = {2025}
}

备注

Code and dataset are available for downloading at: https://github.com/Alpha-Innovator/SurveyForge 22 pages, 10 figures