中文

面向少样本分类的领域对齐 CLIP

计算机视觉与模式识别 2023-11-16 v1

摘要

像 CLIP 这样的大型视觉-语言表示学习模型已展现出在下游任务上令人印象深刻的零样本迁移性能,同时很大程度上受益于通过对比目标实现的模态间(图像-文本)对齐。这种下游性能可通过全规模微调进一步提升,但该方法通常计算密集、需要大量标注数据,并且可能降低分布外(OOD)鲁棒性。此外,仅依赖模态间对齐可能会忽略各单独模态内嵌入的丰富信息。在本工作中,我们为 CLIP 引入一种样本高效的领域自适应策略,称为领域对齐 CLIP(DAC),其在不对主模型进行微调的情况下改善目标分布上的模态内(图像-图像)与模态间对齐。对于模态内对齐,我们引入一个以轻量级适配器,通过模态内对比目标专门训练。为改善模态间对齐,我们引入一个简单框架来调制预计算的类别文本嵌入。所提出的少样本微调框架计算高效、对分布偏移鲁棒,且不改变 CLIP 的参数。我们通过在 11 个广泛使用的图像分类任务上基准测试来研究 DAC 的有效性,在强基线之上以 16-shot 分类取得约 2.3% 的一致提升,并在 4 个 OOD 鲁棒性基准上展示出有竞争力的性能。

关键词

引用

@article{arxiv.2311.09191,
  title  = {Domain Aligned CLIP for Few-shot Classification},
  author = {Muhammad Waleed Gondal and Jochen Gast and Inigo Alonso Ruiz and Richard Droste and Tommaso Macri and Suren Kumar and Luitpold Staudigl},
  journal= {arXiv preprint arXiv:2311.09191},
  year   = {2023}
}

备注

To appear at WACV 2024