中文

基于布尔组合集成从临床笔记中提取 UMLS 概念的实证研究

计算与语言 2021-08-06 v1

摘要

我们在本研究中的目标是调查布尔算子对组合多个自然语言处理(NLP)系统在多个语料库上的标注输出的行为,并评估通过聚合统一医学语言系统(UMLS)Metathesaurus 概念进行过滤如何影响 UMLS 概念命名实体识别(NER)的系统性能。我们使用了三个标注了 UMLS 概念的语料库:2010 i2b2 VA 挑战集(31,161 个标注)、多源临床问题解答集成平台(MiPACQ)语料库(17,457 个标注,含 UMLS 概念唯一标识符)以及 Fairview Health Services 语料库(44,530 个标注)。我们的结果表明,对于 UMLS 概念匹配,MiPACQ 语料库的布尔集成相较于单个系统趋向于更高性能。使用近似网格搜索可帮助优化精确率-召回率权衡,并可提供一组用于选择最优集成集合的启发式规则。

关键词

引用

@article{arxiv.2108.02255,
  title  = {An Empirical Study of UMLS Concept Extraction from Clinical Notes using Boolean Combination Ensembles},
  author = {Greg M. Silverman and Raymond L. Finzel and Michael V. Heinz and Jake Vasilakes and Jacob C. Solinsky and Reed McEwan and Benjamin C. Knoll and Christopher J. Tignanelli and Hongfang Liu and Hua Xu and Xiaoqian Jiang and Genevieve B. Melton and Serguei VS Pakhomov},
  journal= {arXiv preprint arXiv:2108.02255},
  year   = {2021}
}