中文

面向视觉重编程提示的样本特定掩码

机器学习 2024-06-06 v1 计算机视觉与模式识别

摘要

视觉重编程(VR)是一种提示技术,旨在通过学习添加到输入图像中的小规模模式,而非调整模型内的大量参数,将预训练模型(例如,在ImageNet上的分类器)重新用于目标任务(例如,医学数据预测)。模式在输入样本中的位置通常由一个所有样本共享的预定义掩码决定。在本文中,我们展示了共享掩码可能限制VR的泛化能力,并由于缺乏样本级自适应而增加其近似误差。受此发现启发,我们为VR设计了一个新框架,称为样本特定多通道掩码(SMM)。具体来说,SMM采用轻量级ConvNet和逐块插值来生成样本特定的三通道掩码,而不是共享且预定义的掩码。由于我们为单个样本生成不同的掩码,理论上表明,与现有的最先进VR方法相比,SMM减少了目标任务的近似误差。我们还在ResNet和ViT上实证证明了其性能提升。SMM的成功进一步凸显了VR在利用预训练模型潜在知识以应对各种目标任务方面的更广泛适用性。我们的代码可在https://github.com/tmlr-group/SMM获取。

关键词

引用

@article{arxiv.2406.03150,
  title  = {Sample-specific Masks for Visual Reprogramming-based Prompting},
  author = {Chengyi Cai and Zesheng Ye and Lei Feng and Jianzhong Qi and Feng Liu},
  journal= {arXiv preprint arXiv:2406.03150},
  year   = {2024}
}