中文

通过标签无关提示分布学习与偏差校正提升零样本视觉模型性能

计算机视觉与模式识别 2024-10-28 v1

摘要

视觉语言模型,如 CLIP,展示了在使用恰当文本描述时具有惊人的泛化能力。虽然在下游标注数据上优化提示已被证明有效提高性能,但这些方法需要标注成本且受限于标注质量。此外,由于 CLIP 在大规模 Web 数据上进行预训练,存在标签偏差,导致性能不佳。为解决上述问题,我们提出一种称为 Frolic 的标签无关提示分布学习和偏差校正框架,以提升零样本性能。具体而言,我们的 Frolic 学习提示原型的分布,以捕捉多样化的视觉表征,并通过 confidence matching 将其与原始 CLIP 自适应融合。该融合模型进一步通过标签无关的 logit 调整来纠正标签偏差。值得注意的是,我们的方法不仅是训练自由的,而且无需调节超参数。在 16 个数据集上的大量实验表明,我们的方法有效,特别是在使用 CLIP ViT-B/16 时,在 10 个数据集上平均优于最新方法提高了 2.6%2.6\%,在 ImageNet 及其五个分布迁移上平均提高了 1.5%1.5\%。代码已公开于 https://github.com/zhuhsingyuu/Frolic。

关键词

引用

@article{arxiv.2410.19294,
  title  = {Enhancing Zero-Shot Vision Models by Label-Free Prompt Distribution Learning and Bias Correcting},
  author = {Xingyu Zhu and Beier Zhu and Yi Tan and Shuo Wang and Yanbin Hao and Hanwang Zhang},
  journal= {arXiv preprint arXiv:2410.19294},
  year   = {2024}
}

备注

NeurIPS 2024 Spotlight