利用大型语言模型进行生物医学命名实体识别
计算与语言
2025-12-30 v1 人工智能
摘要
背景与目标:生物医学命名实体识别 (BioNER) 是医学信息学中的基础任务,对于下游应用如药物发现和临床试验匹配至关重要。然而,将通用领域的大型语言模型 (LLM) 应用于这一任务常常受限于其缺乏领域特定知识以及低质量训练数据所致的性能下降。为此,我们引入 BioSelectTune,一个高度有效、以数据为中心的框架用于微调 LLM,优先考虑数据质量而非数量。方法与结果:BioSelectTune 将 BioNER 重新定义为结构化 JSON 生成任务,并利用我们新颖的混合 Superfiltering 策略,即一种从弱模型中蒸馏出紧凑高影响训练数据集的弱到强的数据筛选方法。结论:通过大量实验,我们展示 BioSelectTune 在多个 BioNER 基准测试上实现了最先进 (SOTA) 的性能。值得注意的是,我们的模型仅在精选正数据集的一 50% 上训练,就已超越全量训练的基线模型,并超过强大的领域专用模型如 BioMedBERT。
引用
@article{arxiv.2512.22738,
title = {Harnessing Large Language Models for Biomedical Named Entity Recognition},
author = {Jian Chen and Leilei Su and Cong Sun},
journal= {arXiv preprint arXiv:2512.22738},
year = {2025}
}