中文

PubMed 200k RCT:面向医学摘要序列化句子分类的数据集

计算与语言 2017-10-18 v1 人工智能 机器学习

摘要

我们提出了 PubMed 200k RCT,一个基于 PubMed 的用于序列化句子分类的新数据集。该数据集包含约 200,000 篇随机对照试验摘要,共计 230 万个句子。每篇摘要中的每个句子均根据其在摘要中的角色使用以下类别之一进行标注:背景、目的、方法、结果或结论。发布此数据集的目的有两方面。首先,用于序列化短文本分类(即对以序列形式出现的短文本进行分类)的大多数数据集规模都很小:我们希望发布这一新的大型数据集能有助于为该任务开发更准确的算法。其次,从应用角度来看,研究人员需要更好的工具来高效浏览文献。自动对摘要中的每个句子进行分类将有助于研究人员更高效地阅读摘要,尤其是在摘要可能很长的领域,例如医学领域。

关键词

引用

@article{arxiv.1710.06071,
  title  = {PubMed 200k RCT: a Dataset for Sequential Sentence Classification in Medical Abstracts},
  author = {Franck Dernoncourt and Ji Young Lee},
  journal= {arXiv preprint arXiv:1710.06071},
  year   = {2017}
}

备注

Accepted as a conference paper at IJCNLP 2017