Logic Unseen:揭示视觉语言模型的逻辑盲点
计算机视觉与模式识别
2025-08-18 v1 多媒体
摘要
以CLIP为代表的视觉语言模型(VLMs)已成为多模态智能的基础,但其逻辑理解能力得到较少探讨,导致存在显著的"逻辑盲点",限制了其在实际应用中的可靠性。为系统诊断这一问题,我们引入LogicBench——一个包含5万多组视觉语言配对的综合基准,覆盖9个逻辑类别和4种多样化场景:图像、视频、异常检测和医学诊断。我们的评估显示,现有VLMs(即便是最先进的模型)在准确率上比人类低逾40个百分点,尤其在因果性和条件性等具有挑战性的任务中表现更为突出,凸显其对表面语义的依赖而非关键逻辑结构。为弥合这一差距,我们提出LogicCLIP——一种新型训练框架,通过数据生成和优化目标方面的进展提升VLMs的逻辑敏感性。LogicCLIP采用逻辑感知数据生成,并结合粗粒度对齐、细粒度多选目标和新颖的逻辑结构感知目标的对比学习策略。广泛的实验表明,LogicCLIP在LogicBench的所有领域均显著提升了逻辑理解能力,显著优于基线方法。此外,LogicCLIP保持甚至常常超越了在通用视觉语言基准上的竞争性表现,表明增强的逻辑理解并未以牺牲通用对齐为代价。我们认为LogicBench和LogicCLIP将是推动VLM逻辑能力发展的重要资源。
关键词
引用
@article{arxiv.2508.11317,
title = {Logic Unseen: Revealing the Logical Blindspots of Vision-Language Models},
author = {Yuchen Zhou and Jiayu Tang and Shuo Yang and Xiaoyan Xiao and Yuqin Dai and Wenhao Yang and Chao Gou and Xiaobo Xia and Tat-Seng Chua},
journal= {arXiv preprint arXiv:2508.11317},
year = {2025}
}