中文

LGAR:用于系统文献综述中摘要筛选的零样本 LLM 引导神经排序

计算与语言 2025-06-09 v2

摘要

科学文献增长迅速,使得难以跟踪 SOTA。系统文献综述 (SLRs) 旨在识别和评估某一主题的所有相关论文。在检索到一组候选论文后,摘要筛选阶段确定初始相关性。迄今为止,使用大语言模型 (LLMs) 的摘要筛选方法侧重于二分类设置;现有的基于问答 (QA) 的排序方法存在误差传播问题。LLM 为评估 SLR 的纳入和排除标准提供了独特的机会,然而现有的基准测试并未详尽地提供这些标准。我们手动提取了 57 项 SLR(主要在医学领域)的这些标准以及研究问题,从而实现了不同方法之间的原则性比较。此外,我们提出了 LGAR,一种零样本 LLM 引导摘要排序器,由基于 LLM 的分级相关性评分器和密集重排序器组成。我们的广泛实验表明,LGAR 在平均精度均值上比现有的基于 QA 的方法高出 5-10 个百分点。我们的代码和数据已公开。

关键词

引用

@article{arxiv.2505.24757,
  title  = {LGAR: Zero-Shot LLM-Guided Neural Ranking for Abstract Screening in Systematic Literature Reviews},
  author = {Christian Jaumann and Andreas Wiedholz and Annemarie Friedrich},
  journal= {arXiv preprint arXiv:2505.24757},
  year   = {2025}
}

备注

Accepted to ACL Findings 2025