中文

预训练视觉语言模型的高效长尾泛化

计算机视觉与模式识别 2024-06-19 v1 机器学习

摘要

像 CLIP 这样的预训练视觉语言模型通过图像-文本匹配展示了强大的零样例推理能力,并在各种下游任务中证明是强大的 few-shot 学习者。然而,在现实世界场景中,适应 CLIP 到下游任务可能面临以下挑战:1) 数据可能呈现长尾分布,可能不足以覆盖所有类别;2) 可能存在新的任务,其中包含完全没有样本的新类别。为克服这些问题,我们提出了一种新框架实现高效的长尾泛化,可称为 Candle。在训练过程中,我们提出补偿 logit-adjusted loss 以鼓励原型的大边距并缓解 base 类内部以及 base 类与新类之间的不平衡。对于高效适应,我们将 CLIP 模型作为黑盒子并利用提取的特征获取视觉和文本原型进行预测。为了充分利用多模态信息,我们还提出了跨模态注意力来丰富来自两种模态的特征。对于有效的泛化,我们引入虚拟原型来弥补新类的训练图像不足。Candle 在 11 个多样化数据集上实现了最先进的性能,同时大幅减少了训练时间,显示我们方法的优越性。源代码可在 https://github.com/shijxcs/Candle 获取。

关键词

引用

@article{arxiv.2406.12638,
  title  = {Efficient and Long-Tailed Generalization for Pre-trained Vision-Language Model},
  author = {Jiang-Xin Shi and Chi Zhang and Tong Wei and Yu-Feng Li},
  journal= {arXiv preprint arXiv:2406.12638},
  year   = {2024}
}

备注

Accepted by KDD 2024