基于BERT的多模型集成用于电子健康记录中的药物事件分类
计算与语言
2025-07-01 v1 机器学习
摘要
从健康记录和临床笔记中识别关键变量(如药物、疾病、关系)在临床领域具有广泛的应用。n2c2 2022提供了一系列关于自然语言处理在电子健康记录(EHR)上进行临床数据分析挑战的共享任务,其中构建了综合性标注的临床数据上下文化药物事件数据集(CMED)。本研究聚焦于该挑战轨道1中的子任务2,即通过构建新型基于BERT的集成模型从临床笔记中检测和分类药物事件。该方法首先在如维基百科和MIMIC等不同类型大数据上对BERT模型进行预训练。随后,对这些预训练的BERT模型在CMED训练数据上进行微调。这些微调后的BERT模型被用于在CMED测试数据上完成药物事件分类,采用多预测策略。这些由微调BERT模型生成的多个预测被集成以构建最终预测。实验结果表明,基于BERT的集成模型可以有效提高严格Micro-F值约5%,严格Macro-F值约6%。
引用
@article{arxiv.2506.23315,
title = {Ensemble BERT for Medication Event Classification on Electronic Health Records (EHRs)},
author = {Shouvon Sarker and Xishuang Dong and Lijun Qian},
journal= {arXiv preprint arXiv:2506.23315},
year = {2025}
}