中文

视觉语言模型中的基本范畴用法

计算与语言 2025-08-20 v2

摘要

心理学领域长期认识到人类在标记视觉刺激时使用的基本范畴层级,这一概念由 Rosch 于 1976 年提出。该基本范畴层级被发现使用频率最高、信息密度最高,并且有助于在视觉语言任务中通过 priming 效应。在此,我们调查了两种最近发布的开源视觉语言模型(VLMs)中的基本范畴层级。本文表明 Llama 3.2 Vision Instruct(11B)和 Molmo 7B-D 都倾向于使用与人类行为一致的基本范畴层级。此外,模型的偏好与人类行为中细微差异(如生物学与非生物学基本范畴效应)以及已知的专家基本范畴迁移相符,进一步表明 VLMs 从其训练所依赖的人类数据中获得了复杂的认知范畴化行为。我们还发现,我们的专家提示方法的准确率低于非专家提示方法,这与关于使用专家提示方法的流行观点相矛盾。

关键词

引用

@article{arxiv.2503.12530,
  title  = {Basic Category Usage in Vision Language Models},
  author = {Hunter Sawyer and Jesse Roberts and Kyle Moore},
  journal= {arXiv preprint arXiv:2503.12530},
  year   = {2025}
}