胸部 X 射线放射学报告中的病理提取:一项性能研究
信息检索
2018-12-08 v1 计算与语言
摘要
从放射学报告中提取相关病理术语对于正确的图像标签生成和疾病人群研究十分重要。在本文中,我们比较了一些已知的应用程序接口(API)在从放射学报告中提取胸部异常这一任务上的性能。我们探索了若干医学领域专用标注工具,如带有 Non-MEDLINE 和 Mesh On Demand(MOD)选项的 Medical Text Indexer(MTI),以及 IBM 云提供的通用自然语言理解(NLU)API。我们的结果表明,尽管 MTI 和 MOD 旨在提取医学术语,但其性能比 IBM NLU 等通用提取 API 更差。最后,我们训练了一个基于 DNN 的命名实体识别(NER)模型,以从放射学报告中提取关键概念词。我们的模型大幅优于医学专用和通用 API 的性能。我们的结果证明了通用 API 在病理提取任务上的不足,并确立了领域专用模型训练对于改进结果的重要性。我们希望这些结果能激励研究界发布更大规模去标识化的放射学报告语料库,以构建用于病理提取这一重要任务的高精度机器学习模型。
引用
@article{arxiv.1812.02305,
title = {Pathology Extraction from Chest X-Ray Radiology Reports: A Performance Study},
author = {Tahsin Mostafiz and Khalid Ashraf},
journal= {arXiv preprint arXiv:1812.02305},
year = {2018}
}