中文

跨机构评估基于电子健康记录的乳腺癌表型自然语言处理算法

计算与语言 2023-03-16 v1 信息检索 机器学习

摘要

目的:临床大语言模型在开发过程中其泛化性通常被忽视。本研究通过乳腺癌表型抽取任务评估了基于BERT的临床NLP模型在不同临床场景下的泛化性。材料与方法:从明尼苏达大学与梅奥诊所的电子健康记录中收集了两个乳腺癌患者临床语料库,并依同一指南标注。我们开发了三类NLP模型(即条件随机场、双向长短期记忆与CancerBERT)从临床文本中抽取癌症表型。以不同学习策略(模型迁移 vs. 本地训练)在各测试集上评估其泛化性,并以实体覆盖分数评估其与模型性能的关联。结果:我们在UMN和MC分别人工标注了200和161份临床文档。发现两机构的语料库在目标实体上的相似度高于整体语料库。CancerBERT模型在两个临床机构独立测试集与置换测试集上均取得最佳性能。在一个机构开发并进一步在另一机构微调的CancerBERT模型,相较基于本地数据开发的模型取得了合理性能(微F1:0.925 vs 0.932)。结论:结果表明CancerBERT模型在三类临床NLP模型中具备最佳学习能力与泛化性。模型泛化性被发现与语料库间目标实体的相似度相关。

关键词

引用

@article{arxiv.2303.08448,
  title  = {A Cross-institutional Evaluation on Breast Cancer Phenotyping NLP Algorithms on Electronic Health Records},
  author = {Sicheng Zhou and Nan Wang and Liwei Wang and Ju Sun and Anne Blaes and Hongfang Liu and Rui Zhang},
  journal= {arXiv preprint arXiv:2303.08448},
  year   = {2023}
}

备注

16 pages, 3 figures