中文

INSIGHTBUDDY-AI:基于大语言模型和集成学习的药物抽取与实体链接

计算与语言 2024-12-31 v2 人工智能

摘要

药物抽取与挖掘在医疗 NLP 研究中发挥着重要作用,因其在医院环境中的实际应用,如映射到标准临床知识库(SNOMED-CT、BNF 等)。本文我们探索了在药物及其相关属性(如剂量、给药途径、强度和不良反应)上的文本挖掘任务中最先进的大语言模型(LLM)。此外,我们还探讨了不同的集成学习方法(\textsc{Stack-Ensemble} 和 \textsc{Voting-Ensemble})来增强单个 LLM 的模型性能。我们的集成学习结果在一般域和特定域上均优于 individually fine-tuned 的基础模型 BERT、RoBERTa、RoBERTa-L、BioBERT、BioClinicalBERT、BioMedRoBERTa、ClinicalBERT 和 PubMedBERT。最后,我们构建了一个实体链接函数,将提取的医学术语映射到 SNOMED-CT 代码和英国国家药典(BNF)代码,这些代码进一步映射到医药与器械词典(dm+d),以及 ICD。我们的模型工具包和桌面应用程序公开可用(访问 \url{https://github.com/HECTA-UoM/ensemble-NER})。

关键词

引用

@article{arxiv.2409.19467,
  title  = {INSIGHTBUDDY-AI: Medication Extraction and Entity Linking using Large Language Models and Ensemble Learning},
  author = {Pablo Romero and Lifeng Han and Goran Nenadic},
  journal= {arXiv preprint arXiv:2409.19467},
  year   = {2024}
}

备注

ongoing work, 24 pages