视觉语言模型在理解图像变换方面的局限性
计算机视觉与模式识别
2025-03-17 v2 人工智能
计算与语言
摘要
视觉语言模型(VLM)在多种下游任务中展现了显著潜力,包括图像/视频生成、视觉问答、多模态聊天机器人和视频理解。然而,这些模型在基本图像变换方面常常表现不佳。本文研究了VLMs的图像级理解能力,特别是OpenAI的CLIP和Google的SigLIP。我们的发现表明,这些模型缺乏对多种图像级增强操作的理解。为了促进本研究,我们创建了Flickr8k数据集的增强版本,将每张图像与所应用变换的详细描述配对。我们进一步探讨了这一缺陷如何影响下游任务,特别是在图像编辑方面,并评估了最先进的Image2Image模型在简单变换上的性能。
引用
@article{arxiv.2503.09837,
title = {On the Limitations of Vision-Language Models in Understanding Image Transforms},
author = {Ahmad Mustafa Anis and Hasnain Ali and Saquib Sarfraz},
journal= {arXiv preprint arXiv:2503.09837},
year = {2025}
}
备注
8 pages, 15 images