中文

图像 - 标题编码用于提升零样本泛化能力

计算机视觉与模式识别 2024-02-07 v1 计算与语言 机器学习

摘要

视觉 - 语言模型的最新进展结合了对比方法与生成方法,在零样本图像分类等下游推理任务上实现了最先进(SOTA)性能。然而,这些模型在图像分类中的一个持续问题是其分布外(OOD)泛化能力。我们首先表明,当一个 OOD 数据点被错误分类时,正确类别通常存在于 Top-K 预测类别中。为了在评估时将模型预测引导至 Top-K 预测类别中的正确类别,我们提出了图像 - 标题编码(Image-Caption Encoding, ICE)方法,这是一种直接强制图像条件预测与标题条件预测之间一致性的简便方法,且仅在评估时使用。直观地说,我们利用生成标题的独特属性,指导我们在 Top-K 预测类别中局部搜索正确的类别标签。我们表明,我们的方法可以轻松地与其他 SOTA 方法结合,平均将 Top-1 OOD 准确率提高 0.5%,在具有挑战性的数据集上最高可提高 3%。我们的代码:https://github.com/Chris210634/ice

关键词

引用

@article{arxiv.2402.02662,
  title  = {Image-Caption Encoding for Improving Zero-Shot Generalization},
  author = {Eric Yang Yu and Christopher Liao and Sathvik Ravi and Theodoros Tsiligkaridis and Brian Kulis},
  journal= {arXiv preprint arXiv:2402.02662},
  year   = {2024}
}