预训练模型的协作造就更优少样本学习器
计算机视觉与模式识别
2022-11-08 v2
摘要
少样本分类要求深度神经网络仅从有限的训练图像中学习泛化表示,这在低数据场景下具有挑战性但意义重大。近来,基于CLIP的方法凭借对比语言-图像预训练展现出了良好的少样本性能。基于此,我们探究大规模预训练能否缓解少样本数据匮乏,并借助预学习知识辅助表示学习。本文提出CoMo,一种预训练模型的协作方法,它融合来自多种预训练范式的多样化先验知识以实现更优的少样本学习。我们的CoMo包含:CLIP的语言对比知识、DINO的视觉对比知识,以及DALL-E的语言生成知识。具体而言,CoMo从两方面发挥作用:少样本数据扩充与多样化知识集成。其一,我们通过零样本DALL-E生成合成图像,无需任何人力即可丰富少样本训练数据。其二,我们引入可学习的多知识适配器(MK-Adapter)来自适应地融合CLIP与DINO的预测。通过此种协作,CoMo能充分释放不同预训练方法的潜力并将其统一,从而在少样本分类上取得最先进(state-of-the-art)性能。我们在11个数据集上进行了大量实验,以证明我们所提方法的优越性与泛化能力。
引用
@article{arxiv.2209.12255,
title = {Collaboration of Pre-trained Models Makes Better Few-shot Learner},
author = {Renrui Zhang and Bohao Li and Wei Zhang and Hao Dong and Hongsheng Li and Peng Gao and Yu Qiao},
journal= {arXiv preprint arXiv:2209.12255},
year = {2022}
}
备注
10 pages, 6 figures