DISSECT:诊断视觉语言模型中感知与语言先验的边界
计算机视觉与模式识别
2026-04-09 v1 人工智能
摘要
当被问及分子图的描述时,视觉语言模型正确地识别出“一个苯环上带有一个 -OH 基团”。当被问及对同一图像进行推理时,却答错了。该模型能够看见,却无法思考它所看到的内容。我们将此称为感知-集成鸿沟:一种在视觉信息成功提取后丢失的失败现象,这种失败对单一配置基准测试而言是隐形的,因为这些基准测试将感知与集成混合在一个准确率数字下。为系统性地暴露此类失效,我们引入DISSECT,一个覆盖化学(7,000 题)和生物学(5,000 题)的 12,000 题诊断基准测试。每个问题都在五种输入模式下进行评估——视觉+文本、文本-only、视觉-only、人类 oracle 以及一种新颖的模型 oracle,其中 VLM 首先对图像进行语言化描述,然后从自身描述中进行推理——从而产生诊断性差距,将性能分解为语言先验利用、视觉提取、感知忠实度和集成效果。我们评估了 18 个 VLM,发现:(1)化学领域的语言先验利用率显著低于生物学领域,确认分子视觉内容是测试真实视觉推理的更高难度测试;(2)开源模型在从自身语言化描述推理时得分显著高于从原始图像推理,暴露了系统性的集成瓶颈;(3)闭源模型未出现此类差距,表明搭建感知与集成之间的桥梁是区分开源与闭源多模态能力的前沿。模型 oracle 方案对任何 VLM 评估均适用,可在事后诊断集成失效。
引用
@article{arxiv.2604.06250,
title = {DISSECT: Diagnosing Where Vision Ends and Language Priors Begin in Scientific VLMs},
author = {Dikshant Kukreja and Kshitij Sah and Karan Goyal and Mukesh Mohania and Vikram Goyal},
journal= {arXiv preprint arXiv:2604.06250},
year = {2026}
}