中文

幻象-幻象:视觉语言模型在无幻象的地方看到幻象

神经元与认知 2024-12-30 v1 计算与语言 计算机视觉与模式识别

摘要

幻象虽然有趣,但也是认知科学、哲学和神经科学中的有用诊断工具。典型的幻象显示出某物"真实的样子"与"看起来的样子"之间的差距,这一差距有助于我们理解导致某物看起来的样子的心理加工。幻象在探讨人工系统时也很有用,许多研究都考察了计算感知模型是否落入与人类相同的幻象之陷。本文颠倒了感知幻象的标准用途,以考察当前视觉语言模型中的基本处理错误。我向这些模型呈现幻象-幻象,这些是常见幻象的邻居,本应不会引发处理错误。这些包括如完美合理的鸭子、弯曲的直线(这条线确实是弯曲的)、看起来大小不同的圆(它们实际上大小不同)等。我展示了许多当前的视觉语言系统误将这些幻象-幻象视为幻象。我认为,这些失败是更广泛的已在文献中讨论过的失败的组成部分。

关键词

引用

@article{arxiv.2412.18613,
  title  = {The Illusion-Illusion: Vision Language Models See Illusions Where There are None},
  author = {Tomer Ullman},
  journal= {arXiv preprint arXiv:2412.18613},
  year   = {2024}
}

备注

9 pages, 5 figures