中文

LlamaCare:用于增强医疗知识共享的大型医学语言模型

计算与语言 2024-06-06 v2 人工智能

摘要

大型语言模型(LLM)在知识记忆和呈现方面展现了惊人的能力。然而,当涉及领域特定知识和下游任务(如医疗)时,通用LLM往往无法给出精确答案。此外,当人们希望LLM回答分类问题时,通常首先进行指令微调。然而,LLM在指令微调后并不总是给出直接的分类索引。在本文中,我们提出了LlamaCare,一个微调的医学语言模型,以及扩展分类集成(ECI),一个处理LLM分类问题的模块。我们的贡献是:(i)我们以极低的碳排放微调了一个医学知识的大型语言模型,并通过24G GPU实现了与ChatGPT相似的性能。(ii)我们通过提出一个名为扩展分类集成的新模块,解决了冗余分类答案的问题,并提升了LLM的性能。(iii)我们发布了用于一些基准测试(如PubMedQA和USMLE 1-3步)的一次和少次训练的处理后数据。我们的方法在基准测试上达到了与一些具有相同参数量的最先进模型相当的性能,同时通过使用更少的GPU计算时间更加环保。我们的模型、代码和数据集可在\url{https://github.com/Stephen-SMJ/LLamaCare}找到。

关键词

引用

@article{arxiv.2406.02350,
  title  = {LlamaCare: A Large Medical Language Model for Enhancing Healthcare Knowledge Sharing},
  author = {Maojun Sun},
  journal= {arXiv preprint arXiv:2406.02350},
  year   = {2024}
}