中文

DVPT:面向医学图像分析的大型预训练模型动态视觉提示微调

计算机视觉与模式识别 2023-07-20 v1

摘要

有限的标注数据使得在医学领域从零训练模型十分困难,一种重要范式是预训练然后微调。大型预训练模型包含丰富的表示,可适配下游医学任务。然而,现有方法要么调整预训练模型的所有参数,要么调整其任务特定层,忽略了医学图像的输入变化,因此不够高效或有效。本文旨在研究面向医学图像分析的参数高效微调(PEFT),并提出一种称为DVPT的动态视觉提示微调方法。它能以少量可训练参数从大型模型中提取有益于下游任务的知识。首先,通过轻量级瓶颈层转换冻结特征以学习下游医学任务的领域特定分布,然后使用少量可学习视觉提示作为动态查询,与转换后的特征进行交叉注意力,试图获取适用于每个样本的样本特定知识。最后,将特征投影回原始特征维度并与冻结特征聚合。该DVPT模块可在不同Transformer层间共享,进一步减少可训练参数。为验证DVPT,我们在医学分类与分割任务上利用不同预训练模型进行了大量实验。我们发现此类PEFT方法不仅能高效地将预训练模型适配至医学领域,还能在部分标注数据下带来数据效率。例如,以0.5%的额外可训练参数,我们的方法不仅优于最先进的PEFT方法,甚至在医学分类任务上以超过2.20%的Kappa分数超越全微调。它可节省多达60%的标注数据以及ViT-B/16达99%的存储成本。

关键词

引用

@article{arxiv.2307.09787,
  title  = {DVPT: Dynamic Visual Prompt Tuning of Large Pre-trained Models for Medical Image Analysis},
  author = {Along He and Kai Wang and Zhihong Wang and Tao Li and Huazhu Fu},
  journal= {arXiv preprint arXiv:2307.09787},
  year   = {2023}
}