ARETE:基于大型语言模型的文本自动检索 R 包
机器学习
2025-11-07 v1
摘要
1. 实施严格的保育计划的硬性障碍是我们缺乏关键物种数据,尤其是发生数据。此外,研究人员必须应对新信息收集和处理速度的加速,这是由人类活动造成的。范围从科学论文到灰色文献的出版物包含这些关键信息,但其数据通常不易被机器读取,需大量人力工作进行检索。 2. 我们提出了 ARETE R 软件包,这是一款开源软件,旨在以大型语言模型(如 chatGPT)为动力,自动提取物种发生数据。该 R 软件包集成了数据提取与验证过程中的所有步骤,从光学字符识别到异常值检测,再到以表格格式输出。我们通过系统性比较模型化的内容与人类标注员的工作进行了 ARETE 的验证。 3. 我们通过将 GBIF 数据与为 100 种蜘蛛物种自动提取的数据进行比较,展示了该方法的实用性。新提取的数据使已知发生范围(Extent of Occurrence)平均扩大了三个数量级,揭示了这些物种以往在过去被发现的新区域,这可能对空间保育规划和灭绝风险评估具有重要意义。 4. ARETE 使人们能够更快地访问此前未被充分利用的发生数据,这是需要此类数据的项目的潜在变革者。研究人员将能够更好地优先考虑资源,手动验证选定的物种,同时为大多数内容保持自动提取。该工作流程也允许在项目规划期预测可用的书目数据。
引用
@article{arxiv.2511.04573,
title = {ARETE: an R package for Automated REtrieval from TExt with large language models},
author = {Vasco V. Branco and Jandó Benedek and Lidia Pivovarova and Luís Correia and Pedro Cardoso},
journal= {arXiv preprint arXiv:2511.04573},
year = {2025}
}