中文

LLM 是否超越编码器用于生物医学命名实体识别?

计算与语言 2025-04-02 v1

摘要

识别生物医学文本中概念及其类型的 span(例如药物或基因),通常称为生物医学命名实体识别(NER),是信息抽取(IE)管道的基本组件。没有强大的 NER 组件,其他应用程序如知识发现和信息检索都不可实用。最新 NER 方法从传统机器学习模型转向深度神经网络,变换器基编码模型(如 BERT)成为当前标准。然而,解码模型(也称为大语言模型或 LLM)在 IE 中正 gaining traction。但 LLM 驱动的 NER 常忽视位置信息 due to 生成性解码模型。此外,它们在推理时间和硬件需求方面非常昂贵。因此,有必要探讨它们是否在生物医学 NER 中实际胜于编码器,并评估相关权衡(性能 vs 效率)。本研究采用相同的 BIO 实体标记方案(保留位置信息),使用五个包含不同长度实体比例的数据集。我们的结果表明,所选 LLM(Mistral 和 Llama:8B 范围)通常以 F1 分数超过最佳编码模型(BERT-(un)cased、BiomedBERT 和 DeBERTav3:300M 范围)2-8%,除一个数据集外,两者相当。这种提升在长度大于等于 3 个 token 的较长实体中尤为突出。然而,LLM 在推理时要昂贵 1-2 个数量级,可能需要不可接受的硬件成本。因此,在性能差异较小或需要实时用户反馈时,编码器模型可能仍比 LLM 更合适。

关键词

引用

@article{arxiv.2504.00664,
  title  = {Do LLMs Surpass Encoders for Biomedical NER?},
  author = {Motasem S Obeidat and Md Sultan Al Nahian and Ramakanth Kavuluru},
  journal= {arXiv preprint arXiv:2504.00664},
  year   = {2025}
}

备注

Accepted to appear in IEEE ICHI 2025