中文

ColorSwap:用于多模态评估的颜色与词序数据集

计算机视觉与模式识别 2024-08-07 v2 计算与语言

摘要

本文介绍了ColorSwap数据集,旨在评估和提升多模态模型将对象与其颜色相匹配的能力。该数据集由2,000个独特的图像-文本对组成,分为1,000个示例。每个示例包含一个文本-图像对,以及一个“颜色交换”对。我们遵循Winoground模式:示例中的两个文本包含相同的单词,但颜色词被重新排列以修饰不同的对象。该数据集是通过自动文本和图像生成与人类参与相结合的新颖方式创建的。我们评估了图像-文本匹配(ITM)和视觉语言模型(VLM),发现即使是最新模型在此任务上仍然不够稳健。GPT-4V和LLaVA在我们的主要VLM指标上分别得分为72%和42%,尽管使用更先进的提示技术可能会提高它们的性能。在主要ITM指标上,诸如CLIP和SigLIP等对比模型的表现接近随机水平(分别为12%和30%),而非对比模型BLIP ITM的表现更强(87%)。我们还发现,在少于2,000个示例上进行微调,可以在此分布外词序理解任务上带来显著的性能提升。数据集位于:https://github.com/Top34051/colorswap 和 https://huggingface.co/datasets/stanfordnlp/colorswap。

关键词

引用

@article{arxiv.2402.04492,
  title  = {ColorSwap: A Color and Word Order Dataset for Multimodal Evaluation},
  author = {Jirayu Burapacheep and Ishan Gaur and Agam Bhatia and Tristan Thrush},
  journal= {arXiv preprint arXiv:2402.04492},
  year   = {2024}
}

备注

ACL Findings 2024