大型语言模型与合成数据用于监控研究论文中的数据集提及
计算与语言
2025-02-17 v1 人工智能
计算机与社会
数据库
机器学习
摘要
跟踪数据在研究论文中的提及方式和使用情况为改进数据可发现性、质量和生产率提供关键见解。然而,手动识别和分类广阔学术文献中的数据集提及所需大量资源且不可扩展。本文提出了一种机器学习框架,通过利用大型语言模型 (LLM)、合成数据和两阶段微调过程自动化跨学科的数据集提及检测。我们采用从研究论文中零样本提取、LLM 作为判官进行质量评估、以及用于细化的推理智能体,生成弱监督合成数据集。Phi-3.5-mini 指令模型在该数据集上进行预微调,然后在手动标注的子集上进行微调。在推断阶段,基于 ModernBERT 的分类器高效筛选数据集提及,在保持高召回率的同时降低计算开销。我们在held-out手动标注样本上的评估显示,微调后的模型在数据提取准确性方面优于 NuExtract-v1.5 和 GLiNER-large-v2.1。我们的结果表明,LLM 生成的合成数据可有效解决训练数据稀缺问题,提升低资源环境下的模型泛化能力。该框架为可扩展的数据使用监控、增强透明度,支持研究者、资助者和政策制定者识别数据差距并加强数据可访问性,为做出明智决策提供了可能。
引用
@article{arxiv.2502.10263,
title = {Large Language Models and Synthetic Data for Monitoring Dataset Mentions in Research Papers},
author = {Aivin V. Solatorio and Rafael Macalaba and James Liounis},
journal= {arXiv preprint arXiv:2502.10263},
year = {2025}
}
备注
Project GitHub repository at https://github.com/worldbank/ai4data-use