生物医学中的 LLM:面向临床命名实体识别的研究
计算与语言
2024-07-12 v2
摘要
大型语言模型 (LLM) 在各种 NLP 任务中展现出卓越的通用性,但由于语言的复杂性和数据的稀缺性,在生物医学领域面临独特的挑战。本文通过探索提升 NER 任务性能的策略,研究 LLM 在生物医学领域的应用。我们的研究揭示了在生物医学领域精心设计提示的重要性。策略性地选择上下文样本带来了显著提升,在生物医学少样本 NER 的所有基准数据集上 F1 分数提高了约 15-20%。此外,我们的结果表明,通过提示策略整合外部生物医学知识可以增强通用 LLM 的能力,以满足生物医学 NER 的专业需求。利用医学知识库,我们提出的受检索增强生成 (RAG) 启发的方法 DiRAG,能够提升 LLM 在生物医学 NER 上的零样本 F1 分数。代码发布于 \url{https://github.com/masoud-monajati/LLM_Bio_NER}
引用
@article{arxiv.2404.07376,
title = {LLMs in Biomedicine: A study on clinical Named Entity Recognition},
author = {Masoud Monajatipoor and Jiaxin Yang and Joel Stremmel and Melika Emami and Fazlolah Mohaghegh and Mozhdeh Rouhsedaghat and Kai-Wei Chang},
journal= {arXiv preprint arXiv:2404.07376},
year = {2024}
}