MOLE:使用 LLM 进行科学论文的元数据提取与验证
计算与语言
2025-09-19 v2
摘要
元数据提取对于编目和保存数据集至关重要,能够实现有效的研究发现和可复现性,尤其是在当前科学研究呈指数级增长的情况下。尽管 Masader (Alyafeai et al., 2021) 为从阿拉伯语 NLP 数据集的学术文章中提取广泛的元数据属性奠定了基础,但它严重依赖人工标注。在本文中,我们提出了 MOLE,这是一个利用大语言模型 (LLM) 从涵盖非阿拉伯语语言数据集的科学论文中自动提取元数据属性的框架。我们基于模式的方法处理多种输入格式的整篇文档,并整合了稳健的验证机制以确保输出的一致性。此外,我们引入了一个新的基准来评估该任务的研究进展。通过对上下文长度、少样本学习和网络浏览集成的系统分析,我们证明了现代 LLM 在自动化此任务方面展现出可喜的结果,突出了未来进一步改进以确保一致和可靠性能的必要性。我们为研究社区发布了代码:https://github.com/IVUL-KAUST/MOLE 和数据集:https://huggingface.co/datasets/IVUL-KAUST/MOLE。
引用
@article{arxiv.2505.19800,
title = {MOLE: Metadata Extraction and Validation in Scientific Papers Using LLMs},
author = {Zaid Alyafeai and Maged S. Al-Shaibani and Bernard Ghanem},
journal= {arXiv preprint arXiv:2505.19800},
year = {2025}
}