RadLite:面向CPU部署的小型语言模型在放射医学中的多任务LoRA微调
计算与语言
2026-05-05 v2 人工智能
机器学习
摘要
大型语言模型(LLM)在放射医学领域显示出巨大的潜力,但其部署受限于计算需求,无法在资源受限的临床环境中使用。我们研究了3-4亿参数的小型语言模型(SLM)通过LoRA微调是否能够在CPU上实现强大的多任务放射医学性能,从而实现在消费级CPU上的部署。我们对Qwen2.5-3B-Instruct和Qwen3-4B进行微调,训练数据来自162K个样本,覆盖9个放射医学任务——包括10个放射系统的RADS分类、报告生成、时间对比、放射医学自然语言推理(NLI)、命名实体识别(NER)、异常检测、肿瘤分期(N/M staging)和放射医学问答,数据来源于12个公开数据集。两个模型在每个任务上均使用标准化指标进行评估。我们的主要发现表明:(1)LoRA微调显著提升了相对于零样本基线的性能(RADS准确率提升53%,NLI提升60%,N分期提升89%);(2)两个模型表现出互补的优势——Qwen2.5在结构化生成任务中表现更佳,而Qwen3在抽取类任务中占据优势;(3)结合两个模型的任务出题 oracle 集合在所有任务中均实现最佳性能;(4)少数样本提示下的微调模型性能反而下降,表明LoRA适应在专业领域中比基于上下文学习更有效;(5)模型可量化为GGUF格式(约1.8-2.4GB),在消费级硬件上实现4-8个token/秒的CPU部署。我们的工作表明,小型且高效微调的模型——我们统称为RadLite——可以作为可部署在消费级硬件上的实用多任务放射医学AI助手,无需GPU即可完成部署。代码和模型已在https://github.com/RadioX-Labs/RadLite提供。
引用
@article{arxiv.2605.00421,
title = {RadLite: Multi-Task LoRA Fine-Tuning of Small Language Models for CPU-Deployable Radiology AI},
author = {Pankaj Gupta and Kartik Bose},
journal= {arXiv preprint arXiv:2605.00421},
year = {2026}
}