VISaGE:理解视觉通用性与例外
计算与语言
2025-10-15 v1 计算机视觉与模式识别
摘要
虽然视觉语言模型(Vision Language Models, VLMs)在训练期间会学习概念表示的形式的通用知识,但通常用于分析单个实例。当评估实例具有异常性时,这种范式会导致模型中两个先验之间的冲突。第一个是一种务实先验,即文本和视觉输入都相关,这源于 VLM 在一致输入上进行微调;第二个是语义先验,即概念表示通常适用于该类别的实例。为了理解 VLMs 如何权衡这些先验,我们引入了一个新的评估数据集 VISaGE,包含典型和异常图像。在严格平衡的实验中,我们显示,当以不一致图像违反底层务实先验的一致性假设时,概念理解会下降。这种效果在查询单个实例时大于语义先验的影响。
引用
@article{arxiv.2510.12548,
title = {VISaGE: Understanding Visual Generics and Exceptions},
author = {Stella Frank and Emily Allaway},
journal= {arXiv preprint arXiv:2510.12548},
year = {2025}
}
备注
EMNLP 2025