中文

LatteCLIP:基于 LMM-合成文本的无监督 CLIP 微调

计算机视觉与模式识别 2024-10-11 v1 人工智能 计算与语言

摘要

大规模视觉语言预训练 (VLP) 模型(如 CLIP)以其灵活性闻名,可在零样图 setup 中应用于多种应用。然而,当这些模型用于特定领域时,由于领域差距或该领域在训练数据中的欠表现,其性能往往不足。虽然通过在自定义数据集上进行人工标注微调 VLP 模型可解决此问题,但即使是小规模数据集(例如10万样本)的标注也需要高成本,若任务复杂还需专业标注员。为此,我们提出 LatteCLIP,这是一种无监督方法,用于在已知类别名称的自定义领域中进行分类微调,而无需依赖人工标注。我们的方法利用大型多模态模型 (LMM) 为单个图像和图像组生成富有表现力的文本描述。这些提供了额外的上下文信息以指导自定义领域中的微调。由于 LMM 生成的描述容易出现幻觉或遗漏细节,我们引入一种新颖策略,从只提炼有用信息并稳定训练。具体做法是从噪声生成的文本中学习丰富的类别原型表征和双伪标签。我们在10个领域特定数据集上的实验表明,LatteCLIP 在 top-1 accuracy 上平均提升4.74分,其他最先进无监督方法提升3.45分。

关键词

引用

@article{arxiv.2410.08211,
  title  = {LatteCLIP: Unsupervised CLIP Fine-Tuning via LMM-Synthetic Texts},
  author = {Anh-Quan Cao and Maximilian Jaritz and Matthieu Guillaumin and Raoul de Charette and Loris Bazzani},
  journal= {arXiv preprint arXiv:2410.08211},
  year   = {2024}
}