中文

emrQA:用于电子病历问答的大规模语料库

计算与语言 2018-09-05 v1

摘要

我们提出一种新颖的方法,通过重新利用现有用于其他 NLP 任务的标注来生成特定领域的大规模问答(QA)数据集。我们通过在生成电子病历的大规模 QA 数据集时利用社区共享的 i2b2 数据集中针对临床笔记各种 NLP 任务的现有专家标注,展示了该方法的一个实例。所得语料库(emrQA)具有 100 万个问题-逻辑形式对和 400,000+ 个问题-答案证据对。我们刻画了该数据集并通过训练问题到逻辑形式以及问题到答案映射的基线模型来探索其学习潜力。

关键词

引用

@article{arxiv.1809.00732,
  title  = {emrQA: A Large Corpus for Question Answering on Electronic Medical Records},
  author = {Anusri Pampari and Preethi Raghavan and Jennifer Liang and Jian Peng},
  journal= {arXiv preprint arXiv:1809.00732},
  year   = {2018}
}

备注

Accepted at Conference on Empirical Methods in Natural Language Processing (EMNLP) 2018