基于MedCAT的多领域临床自然语言处理:医学概念标注工具包
计算与语言
2021-03-26 v2 人工智能
机器学习
摘要
电子健康记录(EHR)包含大量非结构化文本,需要应用信息抽取(IE)技术以实现临床分析。我们提出了开源的医学概念标注工具包(MedCAT),其提供:a)一种新颖的自监督机器学习算法,用于使用包括UMLS/SNOMED-CT在内的任何概念词表抽取概念;b)一个功能丰富的标注界面,用于定制和训练IE模型;c)与更广泛的CogStack生态系统集成,以实现与供应商无关的健康系统部署。我们展示了在开放数据集上抽取UMLS概念的改进性能(F1:0.448-0.738 对比 0.429-0.650)。进一步的真实世界验证在3家大型伦敦医院展示了SNOMED-CT抽取,其自监督训练基于来自约1700万份临床记录的约88亿词,并使用约6千个临床医生标注示例进一步微调。我们展示了强大的可迁移性(F1 > 0.94),跨医院、数据集和概念类型,表明其具有跨领域、EHR无关的效用,可加速临床与研究用例。
引用
@article{arxiv.2010.01165,
title = {Multi-domain Clinical Natural Language Processing with MedCAT: the Medical Concept Annotation Toolkit},
author = {Zeljko Kraljevic and Thomas Searle and Anthony Shek and Lukasz Roguski and Kawsar Noor and Daniel Bean and Aurelie Mascio and Leilei Zhu and Amos A Folarin and Angus Roberts and Rebecca Bendayan and Mark P Richardson and Robert Stewart and Anoop D Shah and Wai Keong Wong and Zina Ibrahim and James T Teo and Richard JB Dobson},
journal= {arXiv preprint arXiv:2010.01165},
year = {2021}
}
备注
Preprint: 27 Pages, 3 Figures