BiVLC:将视觉语言组合性评估扩展至文本到图像检索
计算机视觉与模式识别
2024-11-05 v2 计算与语言
机器学习
摘要
现有的视觉语言组合性(VLC)基准测试(如 SugarCrepe)被建构为图像到文本检索问题,即给定图像后,模型需在正确的文本描述与合成硬负文本之间进行选择。本文提出了双向视觉语言组合性(BiVLC)数据集。BiVLC 的新颖之处在于引入由合成文本生成的合成硬负图像,从而产生两个图像到文本检索示例(每个图像各一个)以及更重要的两个文本到图像检索示例(每个文本各一个)。人类标注员筛选不合格的示例,确保基准测试的有效性。在 BiVLC 上进行的实验揭示了当前多模态模型的弱点,因为它们在文本到图像方向的表现极差。事实上,若综合考虑两个检索方向,先前研究的结论会发生显著变化。除了基准测试外,我们还展示,使用合成图像和文本训练的对比模型在 SugarCrepe 和 BiVLC 中两个检索方向上均显著优于基础模型。BiVLC 中与人类水平之间的差距 confirms 视觉语言组合性仍是一个具有挑战性的问题。BiVLC 及代码已提供于 https://imirandam.github.io/BiVLC_project_page。
引用
@article{arxiv.2406.09952,
title = {BiVLC: Extending Vision-Language Compositionality Evaluation with Text-to-Image Retrieval},
author = {Imanol Miranda and Ander Salaberria and Eneko Agirre and Gorka Azkune},
journal= {arXiv preprint arXiv:2406.09952},
year = {2024}
}
备注
Accepted to NeurIPS 24 Datasets and Benchmarks Track; Project page at: https://imirandam.github.io/BiVLC_project_page/