打破常识:WHOOPS!一个由合成与组合图像构成的视觉-语言基准
计算机视觉与模式识别
2023-08-15 v4 人工智能
计算与语言
摘要
怪异、不寻常和诡异的图像因其挑战常识而激起观察者的好奇。例如,2022 年世界杯期间发布的一张图像描绘了著名足球明星 Lionel Messi 和 Cristiano Ronaldo 在下棋,这俏皮地违背了我们认为他们的竞争应在足球场上进行的预期。人类能轻易识别并解读这些非传统图像,但 AI 模型可以吗?我们引入 WHOOPS!,一个用于视觉常识的新数据集与基准。该数据集由设计师使用 Midjourney 等公开图像生成工具刻意创作的违背常识的图像组成。我们考虑在该数据集上提出的若干任务。除图像描述、跨模态匹配和视觉问答外,我们引入一项困难的解释生成任务,要求模型识别并解释给定图像为何不寻常。我们的结果显示,GPT3 和 BLIP2 等最先进模型在 WHOOPS! 上仍落后于人类表现。我们希望该数据集能启发具有更强视觉常识推理能力的 AI 模型的发展。数据、模型与代码可在项目网站获取:whoops-benchmark.github.io
引用
@article{arxiv.2303.07274,
title = {Breaking Common Sense: WHOOPS! A Vision-and-Language Benchmark of Synthetic and Compositional Images},
author = {Nitzan Bitton-Guetta and Yonatan Bitton and Jack Hessel and Ludwig Schmidt and Yuval Elovici and Gabriel Stanovsky and Roy Schwartz},
journal= {arXiv preprint arXiv:2303.07274},
year = {2023}
}
备注
Accepted to ICCV 2023. Website: whoops-benchmark.github.io