中文

MedCAT——医学概念标注工具

计算与语言 2019-12-24 v1 机器学习 机器学习

摘要

电子健康记录(EHRs)等生物医学文档包含大量非结构化格式的信息。EHRs 中的数据是记录临床叙述与决策的重要资源,但尽管文本易于被人类医生理解,其在研究与临床应用中却难以利用。为发掘生物医学文档的潜力,我们需要提取并结构化其所含信息。当前任务是命名实体识别与链接(NER+L)。实体数量庞大、词语歧义、重叠与嵌套使得生物医学领域远比许多其他领域困难。为克服这些困难,我们开发了医学概念标注工具(MedCAT),一种用于 NER+L 的无监督开源方法。MedCAT 使用无监督机器学习来消歧实体。它在 MIMIC-III(一个可自由访问的重症监护数据库)和 MedMentions(使用统一医学语言系统提及标注的生物医学论文)上进行了验证。在 NER+L 方面,与现有工具的比较表明,MedCAT 仅通过无监督学习便超越了此前最佳方法(疾病检测的 F1=0.848 对比 0.691;通用概念检测的 F1=0.710 对比 0.222)。对 MedCAT 所学向量嵌入的定性分析表明,它捕捉到了 EHRs(MIMIC-III)中可用的潜在医学知识。无监督学习可提升大规模实体抽取的性能,但在仅涉及少量实体和小数据集时存在局限。此时可选择监督学习或主动学习,二者均通过 MedCATtrainer 扩展在 MedCAT 中得到支持。我们的方法能够以最先进的性能检测和链接数百万种不同的生物医学概念,同时轻量、快速且易于使用。

关键词

引用

@article{arxiv.1912.10166,
  title  = {MedCAT -- Medical Concept Annotation Tool},
  author = {Zeljko Kraljevic and Daniel Bean and Aurelie Mascio and Lukasz Roguski and Amos Folarin and Angus Roberts and Rebecca Bendayan and Richard Dobson},
  journal= {arXiv preprint arXiv:1912.10166},
  year   = {2019}
}

备注

Preprint, 25 pages, 5 figures and 4 tables