GSAP-ERE:面向机器学习的细粒度学术实体与关系抽取
计算与语言
2025-11-13 v1
摘要
机器学习(ML)和人工智能研究的快速演进使得从科学文献中进行信息抽取(IE)成为一种识别大规模上ML相关研究中关于研究概念和资源信息的途径,从而有助于提高对ML相关研究的理解与可重复性。为抽取并连接ML相关研究中的细粒度信息(例如方法训练和数据使用),我们引入了GSAP-ERE。这是一个手动 curated 的细粒度数据集,包含 10 种实体类型和 18 种语义分类的关系类型,涵盖 100 篇ML文献全文中 63K 个实体和 35K 条关系的提及。我们展示了该数据集能够使微调模型自动抽取有关下游任务的相关信息,包括知识图谱(KG)构建,以及大规模监控AI研究的计算可重复性。此外,我们将该数据集用作测试套件,探索使用大型语言模型(LLM)进行IE的提示策略。我们观察到,最先进的LLM提示方法的性能在很大程度上被我们最佳微调基线模型所超越(NER: 80.6%,RE: 54.0% vs. NER: 44.4%,RE: 10.1%)。这种监督模型与非监督使用LLMs之间性能差异的现象表明,像GSAP-ERE这样的数据集对于推动学术信息抽取领域的研究是必需的。
引用
@article{arxiv.2511.09411,
title = {GSAP-ERE: Fine-Grained Scholarly Entity and Relation Extraction Focused on Machine Learning},
author = {Wolfgang Otto and Lu Gan and Sharmila Upadhyaya and Saurav Karmakar and Stefan Dietze},
journal= {arXiv preprint arXiv:2511.09411},
year = {2025}
}
备注
Accepted at AAAI 2026