面向医学图像分类的医学知识干预提示调优
计算机视觉与模式识别
2025-11-18 v1
摘要
视觉语言基础模型(VLMs)在医学相关下游任务中显示出巨大的潜力,能够实现特征迁移和泛化。然而,对这些模型进行微调代价高昂,由于其参数数量庞大。提示调优已成为缓解内存使用并减少训练时间的可行方案,同时保持竞争性能。然而,挑战在于,现有提示调优方法无法准确区分不同类型的医学概念,这忽略了医学图像分类任务中各种医学成像模态上特定疾病相关特征。我们发现,大型语言模型(LLM)在处理大量文本语料训练后,特别擅长提供这种专业医学知识。基于此,我们提出将 LLM 纳入提示调优流程。具体而言,我们引入 CILMP(Conditional Intervention of Large Language Models for Prompt Tuning),一种将 LLM 和 VLM 连接起来以促进医学知识传输至 VLM 提示中的方法。CILMP 从 LLM 中提取疾病特定表示,在低秩线性子空间中进行干预,并利用它们创建疾病特定提示。此外,还引入条件机制,以针对每个医学图像进行条件化干预,生成实例自适应提示,从而增强适应性。跨多个 diverse 医学图像数据集的大量实验表明,CILMP 在各类提示调优方法中 consistently 取得优异性能,证明了其有效性。代码已公开于 https://github.com/usr922/cilmp。
引用
@article{arxiv.2511.12639,
title = {Medical Knowledge Intervention Prompt Tuning for Medical Image Classification},
author = {Ye Du and Nanxi Yu and Shujun Wang},
journal= {arXiv preprint arXiv:2511.12639},
year = {2025}
}
备注
IEEE Transactions on Medical Imaging (Early Access) July 2025