中文

提升多模态模型的零样本泛化能力与鲁棒性

计算机视觉与模式识别 2023-05-26 v2

摘要

CLIP 与 LiT 等多模态图文模型在图像分类基准上展现出令人印象深刻的性能,其零样本泛化能力尤为令人振奋。尽管这些模型的 top-5 零样本准确率非常高,其 top-1 准确率却低得多(某些情况下差距超过 25%)。我们探究了这一性能差距的成因,发现许多失败案例由文本提示的歧义所致。首先,我们开发了一种简单高效的零样本事后方法,通过度量预测对多个提示与图像变换的一致性,来识别 top-1 预测可能错误的图像。我们表明,我们的过程能更好地预测错误,在选择性预测任务上优于常用的 max logit 基线。接着,我们提出一种简单高效的方法,利用 WordNet 层次结构来改善此类不确定图像的准确率:具体地将原始类别与其在语义标签层次中的父节点和子节点相融合,并将该增强嵌入文本提示。我们在 CLIP 与 LiT 模型上基于五个不同的 ImageNet 数据集开展实验。对于 CLIP,我们的方法在不确定的子集上提升 top-1 准确率 17.13%,在整个 ImageNet 验证集上提升 3.6%。我们还表明,我们的方法在 ImageNet 偏移数据集、其他四个数据集以及 LiT 等其他模型架构上均有提升。所提方法无超参数、无需额外模型训练,并可轻松扩展至其他大型多模态架构。代码见 https://github.com/gyhandy/Hierarchy-CLIP。

关键词

引用

@article{arxiv.2212.01758,
  title  = {Improving Zero-shot Generalization and Robustness of Multi-modal Models},
  author = {Yunhao Ge and Jie Ren and Andrew Gallagher and Yuxiao Wang and Ming-Hsuan Yang and Hartwig Adam and Laurent Itti and Balaji Lakshminarayanan and Jiaping Zhao},
  journal= {arXiv preprint arXiv:2212.01758},
  year   = {2023}
}

备注

CVPR 2023