中文

基于 Deepseek R1 的医学垂直大语言模型架构方法

计算与语言 2025-07-23 v2 人工智能

摘要

尽管深度探索 R1 和 ChatGPT 等基础模型取得了显著进展,但其在医学领域的部署面临计算需求和专业知识障碍等关键挑战。本文提出了一种高效轻量级医学大语言模型架构,通过三维优化系统性地解决这些挑战:知识获取、模型压缩和计算提升。我们设计了从 DeepSeek-R1-Distill-70B 到 DeepSeek-R1-Distill-7B 的知识迁移管道,采用低秩适应(LoRA)实现精准的医学知识保留。通过 4 位量化和混合精度策略,我们在保持医学推理能力的同时实现了显著的模型压缩。推理框架集成了 Flash Attention 加速和连续批处理,配合专门为各种医学查询设计的提示模板。实验评估显示,我们的方法在 USMLE 考试中保持 92.1% 的准确率,相较于基线模型将内存消耗降低 64.7%,推理延迟降低 12.4%。本工作为在资源受限的医学环境中部署先进语言模型提供了实用解决方案,使AI辅助医疗更具可及性。

关键词

引用

@article{arxiv.2505.00025,
  title  = {A Method for the Architecture of a Medical Vertical Large Language Model Based on Deepseek R1},
  author = {Mingda Zhang and Jianglong Qin},
  journal= {arXiv preprint arXiv:2505.00025},
  year   = {2025}
}

备注

14 pages, 1 figures