中文

MedicalBERT:使用预训练的基于 BERT 的模型增强生物医学自然语言处理

计算与语言 2025-07-28 v2 人工智能 机器学习

摘要

自然语言处理(NLP)的最新进展由 BERT、RoBERTa、T5 和 GPT 等预训练语言模型所驱动。这些模型擅长理解复杂文本,但具有领域特定术语的生物医学文献带来了挑战,这是 Word2Vec 和双向长短期记忆网络等模型无法完全解决的。尽管 GPT 和 T5 能够捕获上下文,但在需要双向理解的任务中不如 BERT。针对这一问题,我们提出了 MedicalBERT,这是一个在大型生物医学数据集上训练并配备了领域特定词汇的预训练 BERT 模型,增强了对生物医学术语的理解。MedicalBERT 模型经过进一步优化和微调,以处理多种任务,包括命名实体识别、关系抽取、问答、句子相似度和文档分类。我们采用 F1 分数、准确率和 Pearson 相关系数等性能指标,展示了我们的模型与 BioBERT、SciBERT 和 ClinicalBERT 等其他基于 BERT 的模型相比的效率。MedicalBERT 在大多数基准测试中优于这些模型,并且在所有评估任务上平均超越通用 BERT 模型 5.67%。这项工作还强调了利用预训练 BERT 模型处理医学 NLP 任务的潜力,证明了迁移学习技术在捕获领域特定信息方面的有效性。

关键词

引用

@article{arxiv.2507.08013,
  title  = {MedicalBERT: enhancing biomedical natural language processing using pretrained BERT-based model},
  author = {K. Sahit Reddy and N. Ragavenderan and Vasanth K. and Ganesh N. Naik and Vishalakshi Prabhu and Nagaraja G. S},
  journal= {arXiv preprint arXiv:2507.08013},
  year   = {2025}
}