Biomed-DPT:面向生物医学视觉语言模型的双模态提示调优
计算机视觉与模式识别
2025-05-09 v1 人工智能
摘要
提示学习是目前最有效的适配预训练视觉语言模型 (VLM) 以应用于少样本生物医学图像分类任务的范式之一。然而,大多数当前的提示学习方法仅使用文本提示,忽略了生物医学图像中特定结构(如复杂解剖结构和细微病理特征)。本文提出 Biomed-DPT,一种知识增强的双模态提示调优技术。在设计文本提示时,Biomed-DPT 构建包括模板驱动的临床提示和大语言模型 (LLM) 驱动的领域适应提示的双重提示,然后通过知识蒸馏技术从领域适应提示中提取临床知识。在设计视觉提示时,Biomed-DPT 引入零向量作为软提示,以利用注意力重新加权,以避免对非诊断区域的关注以及对非关键病理特征的识别。Biomed-DPT 在覆盖 9 种模态和 10 种器官的 11 个生物医学图像数据集上实现了 66.14% 的平均分类准确率,其中在基类任务中达到 78.06%,在新类任务中达到 75.97%,分别超越了 Context Optimization (CoOp) 方法 6.20%、3.78% 和 8.04%。我们的代码已提供。
引用
@article{arxiv.2505.05189,
title = {Biomed-DPT: Dual Modality Prompt Tuning for Biomedical Vision-Language Models},
author = {Wei Peng and Kang Liu and Jianchen Hu and Meng Zhang},
journal= {arXiv preprint arXiv:2505.05189},
year = {2025}
}