从初学者到专家:将医学知识建模融入通用大语言模型
计算与语言
2024-01-09 v3
摘要
近年来,基于大语言模型(LLM)的人工智能(AI)系统在自然语言理解与生成方面展现出卓越的能力。然而,这些模型在敏感应用(如医学知识推理以及以医生方式回答医学问题)方面仍面临重大挑战。先前的研究尝试通过增大模型规模(>100B)来学习更广泛的通用医学知识,而规模较小的 LLM(<100B)仍有较大提升空间。在本工作中,我们从一个预训练的通用 LLM 模型(AntGLM-10B)出发,通过三阶段优化过程——通用医学知识注入、医学领域指令微调以及特定医学任务适配——将其从医学初学者微调为医学专家(称为 AntGLM-Med-10B)。我们的贡献有三方面:(1)我们专门研究了如何将预训练的通用 LLM 适配到医学领域,特别是针对特定医学任务。(2)我们为优化过程的每个阶段收集并构建了大规模医学数据集。这些数据集涵盖多种数据类型和任务,如问答、医学推理、多项选择题以及医学对话。(3)针对医学领域的多项选择题,我们提出了一种新颖的选择验证(Verification-of-Choice)提示工程方法,显著增强了 LLM 的推理能力。值得注意的是,综合运用上述方法,我们的 AntGLM-Med-10B 模型在 PubMedQA 上能够超越大多数 LLM(包括通用 LLM 和医学 LLM),即便这些 LLM 具有更大的模型规模。
引用
@article{arxiv.2312.01040,
title = {From Beginner to Expert: Modeling Medical Knowledge into General LLMs},
author = {Qiang Li and Xiaoyan Yang and Haowen Wang and Qin Wang and Lei Liu and Junjie Wang and Yang Zhang and Mingyuan Chu and Sen Hu and Yicheng Chen and Yue Shen and Cong Fan and Wangshu Zhang and Teng Xu and Jinjie Gu and Jing Zheng and Guannan Zhang Ant Group},
journal= {arXiv preprint arXiv:2312.01040},
year = {2024}
}
备注
Developed by Ant Group for PubMedQA leaderboard