中文

基于大语言模型与 UMLS 启发式方法的生物医学嵌套命名实体识别

计算与语言 2024-07-09 v1

摘要

本文提出了我们系统用于 BioNNE 英文轨道的方案,旨在从生物医学文本中提取 8 种类型的生物医学嵌套命名实体。我们使用大语言模型(Mixtral 8x7B instruct)和 ScispaCy NER 模型来识别文本中的实体,并基于统一医学语言系统(UMLS)语义类型构建自定义启发式规则来分类这些实体。我们讨论了系统的结果与局限性,并提出未来改进的方案。我们的系统在 BioNNE 验证集上取得 F1 分数为 0.39,在测试集上取得 0.348。

关键词

引用

@article{arxiv.2407.05480,
  title  = {Biomedical Nested NER with Large Language Model and UMLS Heuristics},
  author = {Wenxin Zhou},
  journal= {arXiv preprint arXiv:2407.05480},
  year   = {2024}
}

备注

Submitted to CEUR-WS for the BioNNE task of BioASQ Lab in Conference and Labs of the Evaluation Forum (CLEF) 2024 as a working note