中文

CLIP的在线零样本分类

计算机视觉与模式识别 2024-08-27 v1 机器学习

摘要

视觉语言预训练如CLIP实现了零样本迁移,可根据候选类别名称对图像进行分类。尽管CLIP在多样化的下游任务上显示出惊人的零样本性能,但目标数据分布的利用不足。在本工作中,我们研究了一种新颖的在线零样本迁移场景,其中每张图像以随机顺序到达,仅被访问一次即可获得预测,而无需存储其表示。在与vanilla零样本分类相比,我们的框架在保持灵活性以支持在线服务的同时,考虑到达图像的统计分布作为副信息以捕获目标数据的分布,这有助于提高实际应用的性能。为解决有效在线优化的挑战,我们首先开发了在线标签学习来建模目标数据分布。然后,对每类的视觉空间代理进行进一步优化,以借助提出的在线代理学习方法来缓解图像和文本之间的模态差距。两种在线策略的收敛性均可在理论上得到保证。通过结合来自在线标签学习和代理学习的预测标签,我们的方法(OnZeta)在不访问整个数据集的情况下在ImageNet上实现了78.94%的准确率。此外,在其他13个下游任务上进行大量实验,显示在不同视觉编码器上的平均性能提升超过3%,表明了我们提议有效性。代码可在 \url{https://github.com/idstcv/OnZeta} 获取。

关键词

引用

@article{arxiv.2408.13320,
  title  = {Online Zero-Shot Classification with CLIP},
  author = {Qi Qian and Juhua Hu},
  journal= {arXiv preprint arXiv:2408.13320},
  year   = {2024}
}

备注

accepted by ECCV'24