中文

柠檬何时是紫色的?视觉-语言模型的概念关联偏差

计算机视觉与模式识别 2024-04-16 v2 计算与语言 机器学习

摘要

CLIP 等大规模视觉-语言模型在零样本图像分类和图像到文本检索上展现出令人印象深刻的性能。然而,此类性能在需要视觉与语言间更细粒度对应的任务中并未实现,例如视觉问答(VQA)。作为将这些模型应用于 VQA 及类似任务的困难的一个潜在原因,我们报告了视觉-语言模型中一个有趣的现象,称之为概念关联偏差(CAB)。我们发现具有 CAB 的模型倾向于将输入视为概念袋,并试图跨模态填补其他缺失概念,从而导致意外的零样本预测。我们通过展示当物体(如茄子)与属性(如紫色)间存在强概念关联时 CLIP 的零样本分类性能大幅下降来证实 CAB。我们还表明 CAB 的强度可预测 VQA 上的性能。我们观察到 CAB 在采用对比损失训练的视觉-语言模型中普遍存在,即便联合使用自回归损失时亦然。然而,仅依赖自回归损失的模型似乎表现出极小或没有 CAB 的迹象。

关键词

引用

@article{arxiv.2212.12043,
  title  = {When are Lemons Purple? The Concept Association Bias of Vision-Language Models},
  author = {Yutaro Yamada and Yingtian Tang and Yoyo Zhang and Ilker Yildirim},
  journal= {arXiv preprint arXiv:2212.12043},
  year   = {2024}
}

备注

EMNLP 2023 main