SciNLP:面向 NLP 领域的全文科学实体与关系抽取的领域特定基准
计算与语言
2026-04-06 v4 数字图书馆
信息检索
摘要
从科学文献中提取结构化信息对于捕捉专业领域的核心概念和新兴趋势至关重要。虽然现有数据集有助于模型开发,但大多数专注于特定出版章节,由于领域复杂和标注科学文本的高成本。为此,我们引入 SciNLP - 一个针对自然语言处理 (NLP) 领域的全文实体与关系抽取的专业化基准数据集。该数据集包含 60 个手动标注的全文 NLP 出版物,覆盖 6,409 个实体和 1,648 条关系。与现有研究相比,SciNLP 是首个提供 NLP 领域全文实体及其关系标注的数据集。为验证 SciNLP 的有效性,我们对类似数据集进行了比较实验,并评估了该数据集上现有监督式模型的性能。结果显示,现有模型在不同长度的学术文本中的提取能力存在差异。与现有数据集的跨比较表明,SciNLP 在某些基线模型上实现了显著的性能提升。使用在 SciNLP 上训练的模型,我们实现了对 NLP 领域的自动构建细粒度知识图谱。我们的知识图谱的平均节点度为 3.3,表明其包含丰富的语义拓扑信息,增强了下游应用。该数据集已公开于:https://github.com/AKADDC/SciNLP。
引用
@article{arxiv.2509.07801,
title = {SciNLP: A Domain-Specific Benchmark for Full-Text Scientific Entity and Relation Extraction in NLP},
author = {Decheng Duan and Yingyi Zhang and Jitong Peng and Chengzhi Zhang},
journal= {arXiv preprint arXiv:2509.07801},
year = {2026}
}
备注
EMNLP 2025 Main