基于 LLM 多智能体系统评估系统综述:仿效人类的 SLR 评估
人工智能
2025-09-23 v1 计算与语言
机器学习
多智能体系统
摘要
系统综述(SLR)是证据导向研究的基石,但因其耗时且在不同学科中存在一致性差的问题,仍受到广泛关注。我们构建了一个基于 LLM 的 SLR 评估助手,其采用多智能体系统(MAS)架构,以支持研究人员评估系统综述的整体质量。该系统自动化协议验证、方法学评估和主题相关性检查,利用学术数据库。与传统单智能体方法不同,我们的设计整合了符合 PRISMA 指南的专用智能体方法,以支持更结构化且可解释的评估。我们对五个来自不同领域的已发表 SLR 进行初始研究,将系统输出与专家标注的 PRISMA 分数进行比较,观察到 84% 的一致性。尽管初步结果令人期待,但本工作代表了面向可扩展且准确的 NLP 驱动系统的第一步,这些系统适用于跨学科工作流程,揭示了其在严谨、领域无关的知识聚合方面的能力,以简化综述流程。
引用
@article{arxiv.2509.17240,
title = {Can Agents Judge Systematic Reviews Like Humans? Evaluating SLRs with LLM-based Multi-Agent System},
author = {Abdullah Mushtaq and Muhammad Rafay Naeem and Ibrahim Ghaznavi and Alaa Abd-alrazaq and Aliya Tabassum and Junaid Qadir},
journal= {arXiv preprint arXiv:2509.17240},
year = {2025}
}