中文

大型语言模型用于查询生成的可重复性与可推广性研究

信息检索 2024-11-25 v1

摘要

系统性文献综述(SLR)是学术研究的基石,但由于需要详细的文献策展过程,往往工作量大且耗时。生成式人工智能和大型语言模型(LLM)的出现正在为这一过程带来变革,通过协助研究者完成几项繁琐任务,其中一项是生成有效的布尔查询,以筛选纳入综述的文献。本文presents对布尔查询生成使用LLM进行的广泛研究,复现并扩展了Wang等人和Alaniz等人的工作。我们的研究探讨了使用ChatGPT生成查询的结果的可复制性和可靠性,并将其性能与开源替代方案如Mistral和Zephyr进行比较,以提供更全面的LLM用于查询生成分析。因此,我们实现了一个管道,通过使用先前定义的LLM为给定的综述主题自动创建布尔查询,然后从PubMed数据库检索该查询的所有文档,最后评估结果。通过该管道,我们首先评估使用ChatGPT生成的查询结果是否可重复且一致。随后,我们通过分析和评估开源模型的实际效果,来推广我们的研究结果。最后,我们进行了失败分析,以识别并讨论使用LLM进行布尔查询生成的局限性和不足之处。这一检阅有助于理解LLM应用于信息检索任务中的差距和潜在改进领域。我们的发现突显了LLM在信息检索和文献综述自动化领域的优势、局限性及潜力。

关键词

引用

@article{arxiv.2411.14914,
  title  = {A Reproducibility and Generalizability Study of Large Language Models for Query Generation},
  author = {Moritz Staudinger and Wojciech Kusa and Florina Piroi and Aldo Lipani and Allan Hanbury},
  journal= {arXiv preprint arXiv:2411.14914},
  year   = {2024}
}