中文

SciDMT:用于检测科学提及的大型语料库

人工智能 2024-06-24 v1

摘要

我们提出SciDMT,一个针对科学提及检测的增强和扩展的语料库,为现有相关资源提供了显著的进步。SciDMT包含用于数据集(D)、方法(M)和任务(T)的标注科学文档。该语料库由两个组成部分构成:1) SciDMT主语料库,包含4.8万篇科学文章,超过180万篇弱标注的提及标注,格式为文本片段;2) 评估集,包含100篇手动标注的科学文章用于评估目的。据我们所知,SciDMT是规模最大的科学实体提及检测语料库。该语料库的规模和多样性对于开发和细化面向索引科学论文、增强信息检索以及提高科学知识可访问性的模型任务至关重要。我们通过对先进深度学习架构如SciBERT和GPT-3.5的实验,展示了该语料库的实用性。我们的发现确立了性能基准,突显了科学提及检测中尚未解决的挑战。SciDMT为研究社区提供了一个稳健的基准,鼓励开发创新模型以进一步推动科学信息提取领域的发展。

引用

@article{arxiv.2406.14756,
  title  = {SciDMT: A Large-Scale Corpus for Detecting Scientific Mentions},
  author = {Huitong Pan and Qi Zhang and Cornelia Caragea and Eduard Dragut and Longin Jan Latecki},
  journal= {arXiv preprint arXiv:2406.14756},
  year   = {2024}
}

备注

LREC/COLING 2024