中文

SurveyLens:面向研究学科的自动综述生成基准

计算与语言 2026-02-13 v1

摘要

科学文献的指数级增长推动了自动综述生成(ASG)从简单流程演进为多智能体框架和商业深度研究智能体。然而,现有ASG评估方法依赖通用指标,严重偏向计算机科学(CS),无法评估ASG方法是否遵循各学科的独特标准。 Consequently,尤其是CS领域之外的研究者缺乏明确指导,如何使用ASG系统生成符合特定学科标准的高质量综述。为弥合这一差距,我们引入SurveyLens——首个跨学科的ASG方法评估基准。我们构建SurveyLens-1k,收录10个学科领域的1000篇高质量人工书写综述。随后,我们提出双视角评估框架:(1)学科感知评分准则评估,利用配备人类偏好权重的大语言模型(LLM)衡量对领域特定写作标准的遵循情况;(2)标准对齐评估,对人工综述进行内容覆盖和综合质量的严格测量。我们在SurveyLens上对11种最先进ASG方法进行大规模实验,包括基础LLM、ASG系统和深度研究智能体。分析结果揭示了各方法在不同学科中的distinct优势与不足,为选择契合特定学科需求的工具提供了重要指导。

关键词

引用

@article{arxiv.2602.11238,
  title  = {SurveyLens: A Research Discipline-Aware Benchmark for Automatic Survey Generation},
  author = {Beichen Guo and Zhiyuan Wen and Jia Gu and Senzhang Wang and Haochen Shi and Ruosong Yang and Shuaiqi Liu},
  journal= {arXiv preprint arXiv:2602.11238},
  year   = {2026}
}