SA-MDKIF:面向大语言模型的可扩展且可适应的医学领域知识注入框架
计算与语言
2024-02-02 v1 人工智能
摘要
近期大语言模型 (LLM) 的快速发展在 various natural language processing (NLP) 任务中展现出卓越的性能。然而,其在医学领域的有效应用受限于缺乏医学领域知识。本研究提出 SA-MDKIF,一个可扩展且可适应的框架,通过指令调谐将医学知识注入通用大语言模型,从而实现对 various 下游任务的适应性。SA-MDKIF 包含两个阶段:技能训练和技能适应。在第一个阶段,我们定义 12 项基本医学技能,并基于我们构建的统一格式指令数据集使用 AdaLoRA 对这些技能进行训练。在下一个阶段,我们使用 task-specific 下游数据训练技能路由器,并在推理时使用该路由器将所获取的技能与大语言模型集成。在 9 项不同的医学任务上的实验结果表明,SA-MDKIF 相对于原始大语言模型性能提升 10-20%。值得注意的是,对于未见的医学任务,改进幅度可达最高 30%。
引用
@article{arxiv.2402.00474,
title = {SA-MDKIF: A Scalable and Adaptable Medical Domain Knowledge Injection Framework for Large Language Models},
author = {Tianhan Xu and Zhe Hu and Ling Chen and Bin Li},
journal= {arXiv preprint arXiv:2402.00474},
year = {2024}
}