VisMin:视觉最小化变化理解
计算机视觉与模式识别
2025-01-23 v2 计算与语言
机器学习
摘要
对对象、属性以及对象之间关系的细粒度理解是视觉语言模型(VLM)的关键能力。现有基准主要聚焦于评估 VLM 区分给定图像下两个极为相似标题的能力。本文引入一种新型具有挑战性的基准,称为视觉最小化变化理解(VisMin),要求模型在给定两个图像和两个标题的情况下预测正确的图像-标题匹配。图像对和标题对包含最小化的变化,即一次仅改变以下四个方面之一:对象、属性、计数和空间关系。这些变化测试模型对对象、属性(如颜色、材料、形状)、计数以及对象之间空间关系的理解能力。我们构建了一个使用大型语言模型和扩散模型自动生成框架,随后通过人工标注者进行严格的四步验证。经验实验表明,当前 VLM 在空间关系和计数能力方面存在显著不足。我们还生成了大规模训练数据,用于微调 CLIP 和 Idefics2,显示在各类基准以及 CLIP 通用图像-文本对齐方面,细粒度理解能力显著提升。我们将发布所有资源,包括基准、训练数据以及微调后模型检查点,地址为 https://vismin.net/。
引用
@article{arxiv.2407.16772,
title = {VisMin: Visual Minimal-Change Understanding},
author = {Rabiul Awal and Saba Ahmadi and Le Zhang and Aishwarya Agrawal},
journal= {arXiv preprint arXiv:2407.16772},
year = {2025}
}
备注
Accepted at NeurIPS 2024. Project URL at https://vismin.net/