中文

TDMSci:用于科学文献中任务、数据集与度量实体标注的专用语料库

计算与语言 2021-01-26 v1

摘要

任务、数据集与评估度量是理解实验性科学论文的重要概念。然而,以往大多数科学文献信息抽取工作仅聚焦于摘要,且未将数据集作为独立实体类型对待(Zadeh and Schumann, 2016; Luan et al., 2018)。本文提出一个新语料库,包含从NLP论文抽取的2,000个句子中由领域专家标注的任务(Task, T)、数据集(Dataset, D)、度量(Metric, M)实体。我们报告了使用简单数据增强策略进行TDM抽取的试验结果,并将标注器应用于ACL Anthology中约30,000篇NLP论文。该语料库已公开供社区使用,以促进科学出版物摘要生成(Erera et al., 2019)与知识发现的研究。

关键词

引用

@article{arxiv.2101.10273,
  title  = {TDMSci: A Specialized Corpus for Scientific Literature Entity Tagging of Tasks Datasets and Metrics},
  author = {Yufang Hou and Charles Jochim and Martin Gleize and Francesca Bonin and Debasis Ganguly},
  journal= {arXiv preprint arXiv:2101.10273},
  year   = {2021}
}

备注

accepted at EACL 2021