ConMe:重新思考现代视觉语言模型中组合推理的评估
计算机视觉与模式识别
2024-11-14 v3
摘要
组合推理(CR)涉及对属性、关系和词序意义的把握。近期视觉语言模型(VLMs),由视觉编码器和大型语言模型(LLM)解码器组成,已在此类推理任务中展现出惊人的能力。这引出了一个关键问题:VLMs 是否有效地解决了 CR 挑战?我们推断,现有 CR 基准可能不足以推动现代 VLMs 的边界,原因是其负面文本生成管道依赖于仅使用 LLM。因此,生成的负面样本要么是来自 VLMs LLM 解码器所学习的自然语言分布的异常值,要么在相应的图像上下文中不太可能。为解决这些限制,我们引入ConMe——一个组合推理基准和一种新颖的数据生成管道,利用 VLMs 生成“困难的 CR Q&A”。通过一种新的概念,即 VLMs 相互对话以共同暴露其弱点的管道,我们的管道自主生成、评估并筛选具有挑战性的组合推理问题,建立了一个稳健的 CR 基准,并进行了手动验证。我们的基准导致 CR 性能下降最高可达 33%,即使对于最先进的 VLMs 也重新点燃了 CR 挑战。
引用
@article{arxiv.2406.08164,
title = {ConMe: Rethinking Evaluation of Compositional Reasoning for Modern VLMs},
author = {Irene Huang and Wei Lin and M. Jehanzeb Mirza and Jacob A. Hansen and Sivan Doveh and Victor Ion Butoi and Roei Herzig and Assaf Arbelle and Hilde Kuehne and Trevor Darrell and Chuang Gan and Aude Oliva and Rogerio Feris and Leonid Karlinsky},
journal= {arXiv preprint arXiv:2406.08164},
year = {2024}
}
备注
NeurIPS 2024 Camera Ready