中文

探究 CLIP 模型的局限:表现最差的类别

计算机视觉与模式识别 2023-10-06 v1 机器学习

摘要

对比语言-图像预训练(CLIP)通过将自然语言整合进视觉概念提供了一种基础模型,使其能在下游任务上实现零样本识别。通常期望通过精心设计的文本提示,可在众多领域取得令人满意的总体准确率。然而,我们发现其在最差类别上的表现显著劣于总体表现。例如在 ImageNet 上,尽管总体性能已达 64.1\%,却有总计 10 个类别的逐类准确率仅为 0\%。该现象揭示了使用 CLIP 模型的潜在风险,尤其在特定类别至关重要的风险敏感应用中。为应对此问题,我们探究 CLIP 模型中两种模态间的对齐,并提出类间匹配边界(\cmm)以度量推理混淆。\cmm 可有效识别表现最差的类别并估计候选提示的潜在性能。我们进一步查询大语言模型以丰富最差类别的描述,并构建加权集成以突出高效提示。实验结果明确验证了我们所提方法的有效性:在无需手动提示工程、繁琐优化或访问标注验证数据的情况下,ImageNet 上最差 10 类的准确率提升至 5.2\%。

关键词

引用

@article{arxiv.2310.03324,
  title  = {Investigating the Limitation of CLIP Models: The Worst-Performing Categories},
  author = {Jie-Jing Shao and Jiang-Xin Shi and Xiao-Wen Yang and Lan-Zhe Guo and Yu-Feng Li},
  journal= {arXiv preprint arXiv:2310.03324},
  year   = {2023}
}