中文

条件原型修正提示学习

计算机视觉与模式识别 2024-08-21 v2

摘要

预训练的大规模视觉-语言模型(VLM)已经获得了对一般视觉概念的深刻理解。最近在高效迁移学习(ETL)方面的进展表明,在有限数据场景下微调 VLM 取得了显著成功,仅引入少量参数即可从 VLM 中挖掘任务特定的知识。尽管取得了重大进展,但当前领先的 ETL 方法往往容易对训练期间所见基类的狭窄分布过拟合,并面临两个主要挑战:仅利用单模态信息来建模任务特定知识;以及使用昂贵且耗时的方法来补充知识。为了解决这些问题,我们提出了一种条件原型修正提示学习(CPR)方法,以纠正基类样本的偏差并以有效方式扩充有限数据。具体而言,我们从两个方面缓解对基类的过拟合。首先,每个输入图像从文本和视觉原型中获取知识,然后生成样本条件的文本 token。其次,我们从无标签数据中提取可用知识以进一步精炼原型。这两种策略减轻了源于基类的偏差,产生了更有效的分类器。在11个基准数据集上的广泛实验表明,我们的 CPR 在少样本分类和基类到新类泛化任务上均达到了最先进的性能。我们的代码可在 \url{https://github.com/chenhaoxing/CPR} 获取。

关键词

引用

@article{arxiv.2404.09872,
  title  = {Conditional Prototype Rectification Prompt Learning},
  author = {Haoxing Chen and Yaohui Li and Zizheng Huang and Yan Hong and Zhuoer Xu and Zhangxuan Gu and Jun Lan and Huijia Zhu and Weiqiang Wang},
  journal= {arXiv preprint arXiv:2404.09872},
  year   = {2024}
}