中文

基于CLIP的零样本视觉分类的模态内代理学习

计算机视觉与模式识别 2023-10-31 v1 机器学习

摘要

视觉-语言预训练方法(如 CLIP)借助类名文本嵌入的类别代理,在视觉分类上展现出令人印象深刻的零样本性能。然而,文本与视觉空间之间的模态鸿沟会导致次优性能。我们从理论上表明,该鸿沟无法通过最小化 CLIP 中的对比损失充分缩小,且视觉任务的最优代理可能仅存在于视觉空间中。因此,给定无标签目标视觉数据,我们提出在文本代理的帮助下直接学习视觉代理以实现零样本迁移。此外,根据我们的理论分析,我们开发了策略来进一步精炼由文本代理获得的伪标签,以促进面向视觉的模态内代理学习(InMaP)。在广泛下游任务上的实验证实了我们所提方法的有效性与高效性。具体而言,InMaP 可在单块 GPU 上一分钟内获得视觉代理,同时将 CLIP 预训练的 ViT-L/14@336 在 ImageNet 上的零样本准确率从 77.02%77.02\% 提升至 80.21%80.21\%。代码见 \url{https://github.com/idstcv/InMaP}。

关键词

引用

@article{arxiv.2310.19752,
  title  = {Intra-Modal Proxy Learning for Zero-Shot Visual Categorization with CLIP},
  author = {Qi Qian and Yuanhong Xu and Juhua Hu},
  journal= {arXiv preprint arXiv:2310.19752},
  year   = {2023}
}

备注

accepted by NeurIPS'23