中文

LitLLMs:用于文献综述的大语言模型,我们已经达到了吗?

计算与语言 2025-03-24 v2 人工智能 数字图书馆 机器学习

摘要

文献综述是科学研究的关键组成部分,但由于近期研究论文涌现,仍然耗时且写作具有挑战性。本文探讨了最近大型语言模型(LLM)在基于摘要撰写文献综述方面的零样本能力。我们将任务分解为两个组成部分:1. 给定查询摘要检索相关文献,2. 根据检索结果撰写文献综述。我们分析了 LLM 在这两个组成部分的有效性。对于检索,我们引入一种新颖的两步搜索策略,首先使用 LLM 从论文摘要中提取有意义的关键词,然后通过查询外部知识库检索可能相关的论文。此外,我们研究了一种基于提示的重新排序机制,包含归因信息,表明重新排序比朴素搜索方法的归一化召回率翻倍,并提供了关于 LLM 决策过程的洞察。在生成阶段,我们提出了一种两步方法,首先为综述制定计划,然后执行计划中的步骤以生成实际的综述。为评估不同的 LLM-based 文献综述方法,我们使用旨在避免零样本评估中测试集污染的协议从 arXiv 论文中创建测试集。我们发布了该评估协议,以推动进一步的研究和开发。我们的实证结果表明,LLM 在任务分解为检索和规划等较小组件后,展现出为撰写文献综述的有前景的潜力。我们的项目页面包括演示系统和工具,可在此处访问:https://litllm.github.io。

关键词

引用

@article{arxiv.2412.15249,
  title  = {LitLLMs, LLMs for Literature Review: Are we there yet?},
  author = {Shubham Agarwal and Gaurav Sahu and Abhay Puri and Issam H. Laradji and Krishnamurthy DJ Dvijotham and Jason Stanley and Laurent Charlin and Christopher Pal},
  journal= {arXiv preprint arXiv:2412.15249},
  year   = {2025}
}