基于CLIP的零样本视觉分类的模态内代理学习
计算机视觉与模式识别
2023-10-31 v1 机器学习
摘要
视觉-语言预训练方法(如 CLIP)借助类名文本嵌入的类别代理,在视觉分类上展现出令人印象深刻的零样本性能。然而,文本与视觉空间之间的模态鸿沟会导致次优性能。我们从理论上表明,该鸿沟无法通过最小化 CLIP 中的对比损失充分缩小,且视觉任务的最优代理可能仅存在于视觉空间中。因此,给定无标签目标视觉数据,我们提出在文本代理的帮助下直接学习视觉代理以实现零样本迁移。此外,根据我们的理论分析,我们开发了策略来进一步精炼由文本代理获得的伪标签,以促进面向视觉的模态内代理学习(InMaP)。在广泛下游任务上的实验证实了我们所提方法的有效性与高效性。具体而言,InMaP 可在单块 GPU 上一分钟内获得视觉代理,同时将 CLIP 预训练的 ViT-L/14@336 在 ImageNet 上的零样本准确率从 提升至 。代码见 \url{https://github.com/idstcv/InMaP}。
引用
@article{arxiv.2310.19752,
title = {Intra-Modal Proxy Learning for Zero-Shot Visual Categorization with CLIP},
author = {Qi Qian and Yuanhong Xu and Juhua Hu},
journal= {arXiv preprint arXiv:2310.19752},
year = {2023}
}
备注
accepted by NeurIPS'23