SGSimEval:面向自动问卷生成系统的综合性且相似度增强基准
计算与语言
2025-08-18 v1 人工智能
信息检索
摘要
自动问卷生成(ASG)这一任务长期以来需要大量时间与 effort,近年来受大语言模型(LLM)进步的推动,逐渐受到关注。鉴于检索增强生成(RAG)和多智能体系统(MASs)的不断流行,利用 LLM 合成学术综述已成为可行的路径,进而提升了该领域的评估方法需求。然而,现有评估方法存在诸多局限,包括偏差性指标、缺乏人类偏好以及过度依赖 LLM 作为评判者。为此,我们提出了 SGSimEval——一个集成了轮廓、内容与参考文献评估,并将 LLM 评分与量化指标结合,提供多维度评估框架的 Survey Generation with Similarity-Enhanced Evaluation 基准。SGSimEval 中还引入了强调内在质量与与人类相似性的人类偏好指标。大量实验表明,当前 ASG 系统在轮廓生成方面表现出类人优势,但在内容与参考文献生成方面仍有显著提升空间;我们的评估指标与人类评估保持强大的一致性。
引用
@article{arxiv.2508.11310,
title = {SGSimEval: A Comprehensive Multifaceted and Similarity-Enhanced Benchmark for Automatic Survey Generation Systems},
author = {Beichen Guo and Zhiyuan Wen and Yu Yang and Peng Gao and Ruosong Yang and Jiaxing Shen},
journal= {arXiv preprint arXiv:2508.11310},
year = {2025}
}
备注
Accepted to The 21st International Conference on Advanced Data Mining and Applications (ADMA2025)