中文

基于扩散模型多样化数据增强的有效测试时提示调优

计算机视觉与模式识别 2023-08-21 v2

摘要

得益于提示调优(prompt tuning),近年来预训练视觉-语言模型(如CLIP)在多种下游任务上展现出优异性能。本文关注一种特定设置:为来自未知新领域的每个测试样本即时学习自适应提示,即测试时提示调优(TPT)。现有TPT方法通常依赖数据增强与置信度筛选。然而,传统数据增强技术(如随机缩放裁剪)存在数据多样性不足的问题,而仅基于熵的置信度筛选不足以保证预测保真度。为解决这些问题,我们提出一种名为DiffTPT的新颖TPT方法,利用预训练扩散模型生成多样且信息丰富的新数据。具体而言,我们结合传统方法与预训练稳定扩散(stable diffusion)的增强数据,以发挥各自优势,提升模型对未知新测试数据的适应能力。此外,为保证生成数据的预测保真度,我们引入基于余弦相似度的过滤技术,筛选与单个测试样本相似度更高的生成数据。我们在具有分布偏移和未见类别的测试数据集上的实验表明,与最先进的TPT方法相比,DiffTPT平均提升了5.13%的零样本准确率。我们的代码与模型将公开发布。

关键词

引用

@article{arxiv.2308.06038,
  title  = {Diverse Data Augmentation with Diffusions for Effective Test-time Prompt Tuning},
  author = {Chun-Mei Feng and Kai Yu and Yong Liu and Salman Khan and Wangmeng Zuo},
  journal= {arXiv preprint arXiv:2308.06038},
  year   = {2023}
}

备注

Proceedings of the IEEE/CVF International Conference on Computer Vision 2023