中文

基于双向 GRU 神经网络的临床文本自动 SNOMED CT 概念标注

计算与语言 2025-08-05 v1 机器学习

摘要

使用标准化医学概念自动标注临床文本对于启用结构化数据提取和决策支持至关重要。虽然 SNOMED CT 提供了丰富的本体结构用于标记临床实体,但手动标注在规模上既费时又不实用。本研究引入一种神经序列标注方法,用于 SNOMED CT 概念识别,使用双向 GRU 模型。我们利用 MIMIC-IV 的子集,采用领域适应的 SpaCy 和基于 SciBERT 的分词方法,对文本进行预处理,将句子分割为重叠的 19 token 块,并丰富了包含上下文、句法和形态特征的上下文信息。该 Bi-GRU 模型分配 IOB 标签以识别概念范围,并在验证集上实现了 90% 的 F1 分数。这些结果超越了传统基于规则的系统,甚至与现有神经模型相当或更好。定性分析显示,该模型有效处理了模糊术语和拼写错误。我们的发现表明,轻量级的 RNN 架构能够以显著更低的计算成本实现高质量的临床概念标注,这使其特别适用于实际部署。

关键词

引用

@article{arxiv.2508.02556,
  title  = {Automated SNOMED CT Concept Annotation in Clinical Text Using Bi-GRU Neural Networks},
  author = {Ali Noori and Pratik Devkota and Somya Mohanty and Prashanti Manda},
  journal= {arXiv preprint arXiv:2508.02556},
  year   = {2025}
}