临床阅读理解:对 emrQA 数据集的深入分析
计算与语言
2020-05-05 v1
摘要
得益于大规模标注数据集,机器阅读理解近年来取得了巨大进展。然而,在临床领域,由于标注所需的领域专业知识,创建此类数据集相当困难。最近,Pampari 等人(EMNLP'18)通过使用专家标注的问题模板和已有的 i2b2 标注来创建 emrQA,解决了这一问题,这是首个基于临床记录的大规模问答(QA)数据集。在本文中,我们对该数据集及临床阅读理解(CliniRC)任务提供了深入分析。从我们的定性分析中,我们发现(i)emrQA 的答案常常不完整,且(ii)emrQA 的问题常无需使用领域知识即可回答。从我们的定量实验中,令人惊讶的结果包括(iii)使用一小部分采样子集(5%-20%),我们可获得与在整个数据集上训练的模型大致相当的性能,(iv)该性能接近人类专家的性能,以及(v)BERT 模型并未击败性能最佳的基础模型。在对 emrQA 分析之后,我们进一步探索了 CliniRC 系统两个期望的方面:利用临床领域知识的能力,以及泛化到未见问题和上下文的能力。我们认为在创建未来数据集时两者都应被考虑。
引用
@article{arxiv.2005.00574,
title = {Clinical Reading Comprehension: A Thorough Analysis of the emrQA Dataset},
author = {Xiang Yue and Bernal Jimenez Gutierrez and Huan Sun},
journal= {arXiv preprint arXiv:2005.00574},
year = {2020}
}
备注
Accepted by ACL 2020