大型预训练语言模型在上下文化药物事件抽取上的系统性比较分析
计算与语言
2025-09-26 v1 人工智能
摘要
基于注意力的模型已成为对临床笔记中的医疗语言进行自然语言处理(NLP)建模的主导方法。这些模型通过有效捕获语言的上下文表示,超越了传统技术。本研究在电子健康记录(EHR)信息抽取相关任务上,对预训练的基于注意力的模型(即 Bert Base、BioBert、两种 Bio+Clinical Bert 变体、RoBerta 和 Clinical Longformer)进行了比较分析。该比较采用了哈佛医学院 2022 年全国临床 NLP 挑战赛(n2c2)赛道 1 的任务,并为这些任务提供了上下文化药物事件数据集(CMED)。CMED 是一个包含非结构化 EHR 和标注笔记的数据集,其中包含与 EHR 相关的任务信息。该挑战赛的目标是开发有效的数据驱动解决方案,从 EHR 中提取与患者药物事件相关的上下文信息。每个预训练模型均在 CMED 上进行微调并应用,以执行药物抽取、医疗事件检测和多维药物事件上下文分类。本文还详细介绍了为使 EHR 与所应用模型兼容而对其进行分解的处理方法。性能分析使用基于从 CMED 评估部分构建医学术语的脚本进行,指标包括召回率、精确率和 F1-Score。结果表明,在临床数据上预训练的模型在检测药物和药物事件方面更为有效,但在对与药物相关的事件上下文进行分类时,在通用领域数据上预训练的 Bert Base 表现最佳。
引用
@article{arxiv.2509.19224,
title = {Systematic Comparative Analysis of Large Pretrained Language Models on Contextualized Medication Event Extraction},
author = {Tariq Abdul-Quddoos and Xishuang Dong and Lijun Qian},
journal= {arXiv preprint arXiv:2509.19224},
year = {2025}
}