视觉语言模型中表征失效的几何结构
计算机视觉与模式识别
2026-02-10 v1 人工智能
摘要
视觉语言模型(VLMs)在多对象视觉任务中表现出诡异的失效现象,如幻觉地生成不存在的元素,或未能识别干扰物中最相似的对象。虽然这些错误类似于人类认知约束(如“绑定问题”),但人工系统中驱动这些内部机制却鲜为人知。本文通过分析开源VLMs(Qwen、InternVL、Gemma)的表征几何,提出一种机械化见解,通过方法来提炼“概念向量”——编码视觉概念的潜在方向。我们通过引导干预验证了这些概念向量,在简化和自然视觉任务中均能可靠地操控模型行为(例如,使模型将红色花朵误认为蓝色)。我们观察到,这些向量之间的几何重叠与特定错误模式强烈相关,为理解内部表征如何塑造模型行为并驱动视觉失效提供了以量化框架。
引用
@article{arxiv.2602.07025,
title = {The Geometry of Representational Failures in Vision Language Models},
author = {Daniele Savietto and Declan Campbell and André Panisson and Marco Nurisso and Giovanni Petri and Jonathan D. Cohen and Alan Perotti},
journal= {arXiv preprint arXiv:2602.07025},
year = {2026}
}