利用多个LLM进行信息检索:生物多样性出版物中深度学习方法的案例研究
信息检索
2024-11-15 v1 人工智能
摘要
深度学习技术越来越多地应用于各个领域的科学研究中,以解决复杂的研究问题。然而,这些DL模型的方法论细节往往隐藏在非结构化文本中。因此,关于这些模型如何设计、训练和评估的关键信息难以获取和理解。为了解决这个问题,在本研究中,我们使用五个不同的开源大型语言模型:Llama-3 70B、Llama-3.1 70B、Mixtral-8x22B-Instruct-v0.1、Mixtral 8x7B和Gemma 2 9B,结合检索增强生成方法,从科学出版物中自动提取并处理DL方法论细节。我们根据五个LLM的输出构建了一个投票分类器,以准确报告DL方法信息。我们在先前研究的基础上,使用生物多样性出版物测试了我们的方法。为了验证我们的流程,我们采用了两个与DL相关的生物多样性出版物数据集:一个来自我们先前工作的100篇出版物的精选集,以及一个来自《Ecological Informatics》期刊的364篇出版物的集合。我们的结果表明,多LLM、RAG辅助的流程增强了DL方法信息的检索,仅基于出版物的文本内容就达到了69.5%的准确率(600次比较中的417次)。该性能评估是与能够访问代码、图表、表格和其他补充信息的人工标注员进行对比得出的。尽管在生物多样性领域进行了演示,我们的方法并不局限于该领域;它可以应用于其他需要详细的方法论报告以促进知识进步和确保可复现性的科学领域。本研究提出了一种可扩展且可靠的自动化信息提取方法,促进了不同研究之间更好的可复现性和知识转移。
引用
@article{arxiv.2411.09269,
title = {Harnessing multiple LLMs for Information Retrieval: A case study on Deep Learning methodologies in Biodiversity publications},
author = {Vamsi Krishna Kommineni and Birgitta König-Ries and Sheeba Samuel},
journal= {arXiv preprint arXiv:2411.09269},
year = {2024}
}