中文

嵌入式视觉提示调优

计算机视觉与模式识别 2025-03-24 v5 人工智能

摘要

大规模数据预训练的基础模型已在各种自然图像下游任务中取得成功。参数高效微调(PEFT)方法旨在通过仅更新一小部分参数来适应新领域,以减少计算开销。然而,这些PEFT方法,特别是在跨域少样本场景(如医学图像分析)中,的有效性尚未得到充分探索。本文促进了研究PEFT在适应医学图像分类任务时的性能。进一步地,为缓解主流提示调优方法在引入提示方式和近似能力方面的局限性,我们提出了嵌入式提示调优(EPT)方法,通过将提示标记嵌入到扩展通道中。我们还发现,在预训练过程中,基础模型特征空间分布存在异常,提示调优可帮助缓解这一负面影响。为解释这一现象,我们引入了一种新视角来理解提示调优:提示调优是分布校准器。我们通过分析EPT中包含的patch级缩放和特征分离操作来支持这一观点。我们的实验表明,EPT在少样本医学图像分类任务上显著优于几种最先进的微调方法,同时以高度竞争的时间完成微调,表明EPT是一种有效的PEFT方法。源代码已在github.com/zuwenqiang/EPT上提供。

关键词

引用

@article{arxiv.2407.01003,
  title  = {Embedded Visual Prompt Tuning},
  author = {Wenqiang Zu and Shenghao Xie and Qing Zhao and Guoqi Li and Lei Ma},
  journal= {arXiv preprint arXiv:2407.01003},
  year   = {2025}
}