CliCR:用于机器阅读理解的临床病例报告数据集
计算与语言
2018-03-28 v1
摘要
我们提出了一个用于医学领域机器阅读理解的新数据集。我们的数据集使用临床病例报告,包含大约 100,000 个关于这些病例的填空式查询。我们将多个基线模型和 SOTA 神经阅读器应用于该数据集,并观察到最佳人类阅读器与机器阅读器之间存在显著的性能差距(20% F1)。我们分析了成功回答问题所需的技能,并展示了阅读器的性能如何随适用技能的不同而变化。我们发现,利用领域知识和对象追踪进行推理是最常被需要的技能,而识别省略信息和时空推理对机器而言最为困难。
引用
@article{arxiv.1803.09720,
title = {CliCR: A Dataset of Clinical Case Reports for Machine Reading Comprehension},
author = {Simon Šuster and Walter Daelemans},
journal= {arXiv preprint arXiv:1803.09720},
year = {2018}
}
备注
Accepted at NAACL 2018