SciER:一个面向科学文档中数据集、方法和任务的实体与关系抽取数据集
计算与语言
2024-10-29 v1
摘要
科学信息抽取(SciIE)对于将学术文章中的非结构化知识转化为结构化数据(实体和关系)至关重要。已有多个数据集被提出用于训练和验证 SciIE 模型。然而,由于科学文本标注的高度复杂性和成本,这些数据集将其标注限制在论文的特定部分,如摘要,导致上下文中的多样化实体提及和关系丢失。在本文中,我们发布了一个新的实体和关系抽取数据集,该数据集针对科学文章中与数据集、方法和任务相关的实体。我们的数据集包含 106 篇经过人工标注的全文科学出版物,拥有超过 24,000 个实体和 12,000 个关系。为了捕捉全文中实体间复杂的使用和交互,我们的数据集包含了一套细粒度的关系标签集。此外,我们提供了一个分布外测试集,以提供更现实的评估。我们进行了全面的实验,包括最先进的监督模型和我们提出的基于 LLM 的基线,并强调了我们的数据集带来的挑战,鼓励开发创新模型以推动 SciIE 领域的发展。
引用
@article{arxiv.2410.21155,
title = {SciER: An Entity and Relation Extraction Dataset for Datasets, Methods, and Tasks in Scientific Documents},
author = {Qi Zhang and Zhijia Chen and Huitong Pan and Cornelia Caragea and Longin Jan Latecki and Eduard Dragut},
journal= {arXiv preprint arXiv:2410.21155},
year = {2024}
}
备注
EMNLP2024 Main