中文

面向小样本分类的多样化域内合成与高效微调

计算机视觉与模式识别 2023-12-11 v2

摘要

小样本图像分类旨在仅使用每类少量标注样本来学习图像分类器。近期一个改进小样本分类器的研究方向是利用最先进的文本到图像生成模型创建的合成图像来扩充标注样本。遵循这一趋势,我们提出了多样化域内合成与高效微调(DISEF),这是一种利用合成数据解决小样本学习中泛化挑战的新方法。DISEF包含两个主要组成部分。首先,我们提出了一种新颖的文本到图像增强流程,通过利用真实样本及其来自先进描述模型的丰富语义,促进域内样本多样性以实现更好的泛化。其次,我们强调了在小样本识别中有效模型微调的重要性,提出使用低秩适应(Low-Rank Adaptation, LoRA)对视觉语言模型中的文本和图像编码器进行联合适应。我们在十个不同的基准上验证了我们的方法,一致优于基线方法,并为小样本分类建立了新的最先进水平。代码可在 https://github.com/vturrisi/disef 获取。

关键词

引用

@article{arxiv.2312.03046,
  title  = {Diversified in-domain synthesis with efficient fine-tuning for few-shot classification},
  author = {Victor G. Turrisi da Costa and Nicola Dall'Asen and Yiming Wang and Nicu Sebe and Elisa Ricci},
  journal= {arXiv preprint arXiv:2312.03046},
  year   = {2023}
}

备注

14 pages, 6 figures, 8 tables