中文

OpenMed NER:面向生物医学 NER 的开源、领域适应 SOTA 变换模型

计算与语言 2025-08-05 v1 人工智能

摘要

命名实体识别(NER)是从构筑化信息的关键手段,因为超过 80% 的医疗数据都以非结构化临床笔记和生物医学文献形式存在。尽管大语言模型近期取得了进展,但在保持计算效率的同时实现跨多样实体类型的 SOTA 性能仍是重大挑战。我们提出 OpenMed NER,一套开源、领域适应变换模型,结合轻量级领域自适应预训练(DAPT)和参数高效低秩适配(LoRA)。我们的方法在 35 万篇论文语料上进行成本效益的 DAPT,该语料来自伦理获取的公开研究存储库和去标识化的临床笔记(PubMed、arXiv 和 MIMIC-III),采用 DeBERTa-v3、PubMedBERT 和 BioELECTRA 作为 backbone。随后采用 LoRA 进行任务特定微调,该方法仅更新不足 1.5% 的模型参数。我们在 12 个已建立的生物医学 NER 基准上评估这些模型,涵盖化学品、疾病、基因和物种。OpenMed NER 在 10 个数据集上取得新 SOTA micro-F1 分数,跨各种实体类型实现显著提升。我们的模型在基础疾病和化学基准(例如 BC5CDR-Disease,提升 2.70 分)上推动 SOTA 前进,同时在更专业的基因和临床细胞系语料上实现超过 5.3 和 9.7 个百分点的更大改进。这一工作表明,战略性地调整的开源模型可以超越闭源解决方案。这种性能以极大的效率实现:训练在单块 GPU 上完成时间不足 12 小时,碳足迹低于 1.2 kg CO2e,产生带宽许可的开源模型检查点,旨在帮助实践者顺利遵循新兴数据保护和 AI 法规(如欧盟 AI 法案)。

关键词

引用

@article{arxiv.2508.01630,
  title  = {OpenMed NER: Open-Source, Domain-Adapted State-of-the-Art Transformers for Biomedical NER Across 12 Public Datasets},
  author = {Maziyar Panahi},
  journal= {arXiv preprint arXiv:2508.01630},
  year   = {2025}
}