基于 Transformer 的医学实体抽取方法:利用预训练语言模型和少量样本学习提升信息抽取能力
计算与语言
2025-04-08 v1
摘要
本研究提出了一种基于 Transformer 的医学实体抽取方法,以增强医学文献的信息抽取能力。鉴于医学文本的专业性和复杂性,我们比较了不同预训练语言模型(BERT、BioBERT、PubMedBERT、ClinicalBERT)在医学实体抽取任务中的性能。实验结果表明,PubMedBERT 取得最佳性能(F1-score = 88.8%),表明在生物医学文献上预训练的语言模型在医学领域更为有效。此外,我们分析了不同实体抽取方法(CRF、基于区间、Seq2Seq)的影响,发现基于区间的方法在医学实体抽取任务中表现最佳(F1-score = 88.6%),其在识别实体边界方面具有优越的准确性。在低资源场景下,我们进一步探索了少量样本学习在医学实体抽取中的应用。实验结果表明,即使仅使用 10 条样本进行训练,模型也能实现 F1-score = 79.1%,验证了在数据有限条件下少量样本学习的有效性。本研究确认,预训练语言模型与少量样本学习的结合可以提高医学实体抽取的准确率。未来研究可整合知识图谱和主动学习策略,以提高模型的泛化性和稳定性,为医学 NLP 研究提供更有效的解决方案。
引用
@article{arxiv.2504.04385,
title = {Pre-trained Language Models and Few-shot Learning for Medical Entity Extraction},
author = {Xiaokai Wang and Guiran Liu and Binrong Zhu and Jacky He and Hongye Zheng and Hanlu Zhang},
journal= {arXiv preprint arXiv:2504.04385},
year = {2025}
}