中文

探索预训练语言模型在临床命名实体识别中的价值

计算与语言 2023-10-31 v4 人工智能 机器学习

摘要

利用通用或领域数据预训练的语言模型 (PLMs) 在资源有限的情况下微调至特定任务的做法,在自然语言处理 (NLP) 领域内已颇受欢迎。在本工作中,我们重新审视该假设,并在临床 NLP 中开展调查,具体为药物及其相关属性的命名实体识别。我们将从头训练的 Transformer 模型与微调的基于 BERT 的 LLM(即 BERT、BioBERT 和 ClinicalBERT)进行比较。此外,我们考察了额外 CRF 层对此类模型的影响,以鼓励上下文学习。我们使用 n2c2-2018 共享任务数据进行模型开发与评估。实验结果表明:1) CRF 层改进了所有语言模型;2) 参照采用宏平均 F1 分数的 BIO-strict 跨度级评估,尽管微调 LLM 取得了 0.83+ 的分数,从头训练的 TransformerCRF 模型取得了 0.78+,展现出可比性能且成本大幅降低——例如训练参数减少 39.80%;3) 参照采用加权平均 F1 分数的 BIO-strict 跨度级评估,ClinicalBERT-CRF、BERT-CRF 和 TransformerCRF 表现出较低分数差异,分别为 97.59%/97.44%/96.84%;4) 通过下采样进行高效训练以改善数据分布,进一步降低了训练成本与数据需求,同时保持相近分数——即相较使用完整数据集低约 0.02 分。我们的模型将托管于 \url{https://github.com/HECTA-UoM/TransformerCRF}。

关键词

引用

@article{arxiv.2210.12770,
  title  = {Exploring the Value of Pre-trained Language Models for Clinical Named Entity Recognition},
  author = {Samuel Belkadi and Lifeng Han and Yuping Wu and Goran Nenadic},
  journal= {arXiv preprint arXiv:2210.12770},
  year   = {2023}
}

备注

working paper - Large Language Models, Fine-tuning LLMs, Clinical NLP, Medication Mining, AI for Healthcare