条件原型修正提示学习
计算机视觉与模式识别
2024-08-21 v2
摘要
预训练的大规模视觉-语言模型(VLM)已经获得了对一般视觉概念的深刻理解。最近在高效迁移学习(ETL)方面的进展表明,在有限数据场景下微调 VLM 取得了显著成功,仅引入少量参数即可从 VLM 中挖掘任务特定的知识。尽管取得了重大进展,但当前领先的 ETL 方法往往容易对训练期间所见基类的狭窄分布过拟合,并面临两个主要挑战:仅利用单模态信息来建模任务特定知识;以及使用昂贵且耗时的方法来补充知识。为了解决这些问题,我们提出了一种条件原型修正提示学习(CPR)方法,以纠正基类样本的偏差并以有效方式扩充有限数据。具体而言,我们从两个方面缓解对基类的过拟合。首先,每个输入图像从文本和视觉原型中获取知识,然后生成样本条件的文本 token。其次,我们从无标签数据中提取可用知识以进一步精炼原型。这两种策略减轻了源于基类的偏差,产生了更有效的分类器。在11个基准数据集上的广泛实验表明,我们的 CPR 在少样本分类和基类到新类泛化任务上均达到了最先进的性能。我们的代码可在 \url{https://github.com/chenhaoxing/CPR} 获取。
引用
@article{arxiv.2404.09872,
title = {Conditional Prototype Rectification Prompt Learning},
author = {Haoxing Chen and Yaohui Li and Zizheng Huang and Yan Hong and Zhuoer Xu and Zhangxuan Gu and Jun Lan and Huijia Zhu and Weiqiang Wang},
journal= {arXiv preprint arXiv:2404.09872},
year = {2024}
}