中文

BERT NER 模型临床实体抽取中的噪声消除

计算与语言 2026-03-03 v1 人工智能 信息检索

摘要

在从临床笔记和报告中抽取临床实体的领域中, 精度至关重要. 为此目的, 以 Named Entity Recognition (NER) 为目标的编码模型是高效的选择, 由于它们不会幻觉. 我们在临床数据上预训练了一个内部 BERT, 然后为 NER 微调. 这些模型在召回率上表现良好, 但无法接近临床模型所需的高精度范围. 为了解决这一挑战, 我们开发了一个噪声消除模型用于细化 NER 的输出. NER 模型为每个 token 分配实体标签并附带每个 token 的概率得分. 我们的噪声消除 (NR) 模型随后分析这些概率序列并将预测分类为弱或强. 幼稚方法可能涉及基于低概率值的过滤预测; 然而, 这种方法不可靠. 由于 SoftMax 函数的特性,基于 Transformer 的架构往往对不确定或弱预测也会分配相对较高的置信度得分, 这使得简单的阈值化无效. 为了解决这一问题, 我们采用监督建模策略, 其中 NR 模型利用诸如概率密度图 (PDM) 等高级特征. PDM 捕获 Transformer 嵌入中观察到的语义拉力效应, 该效应在 NER 类别预测概率分布在 token 序列中显现. 这种方法使模型能够以显著优于以往的准确率对预测进行弱/强分类. 通过这些 NR 模型, 我们能够将 various 临床 NER 模型中的假阳性减少 50% 到 90%.

关键词

引用

@article{arxiv.2603.00022,
  title  = {Noise reduction in BERT NER models for clinical entity extraction},
  author = {Kuldeep Jiwani and Yash K Jeengar and Ayush Dhaka},
  journal= {arXiv preprint arXiv:2603.00022},
  year   = {2026}
}