DMDD:用于数据集提及检测的大规模数据集
计算与语言
2023-10-06 v1 人工智能
摘要
数据集名称的识别是科学文献中自动信息抽取的关键任务,使研究人员能够理解并识别研究机会。然而,现有的数据集提及检测语料库在规模和命名多样性上均有限。本文中,我们介绍数据集提及检测数据集(DMDD),这是该任务公开可用的最大语料库。DMDD 由 DMDD 主语料库和一个评估集组成:主库包含 31,219 篇科学论文,其中超过 449,000 个数据集提及以文内跨度格式弱标注;评估集包含 450 篇为评估目的人工标注的科学论文。我们使用 DMDD 建立数据集提及检测与链接的基线性能。通过分析多种模型在 DMDD 上的表现,我们能够识别数据集提及检测中的开放问题。我们邀请学界使用我们的数据集作为挑战,以开发新颖的数据集提及检测模型。
引用
@article{arxiv.2305.11779,
title = {DMDD: A Large-Scale Dataset for Dataset Mentions Detection},
author = {Huitong Pan and Qi Zhang and Eduard Dragut and Cornelia Caragea and Longin Jan Latecki},
journal= {arXiv preprint arXiv:2305.11779},
year = {2023}
}
备注
Pre-MIT Press publication version. Submitted to TACL