幻象-幻象:视觉语言模型在无幻象的地方看到幻象
神经元与认知
2024-12-30 v1 计算与语言
计算机视觉与模式识别
摘要
幻象虽然有趣,但也是认知科学、哲学和神经科学中的有用诊断工具。典型的幻象显示出某物"真实的样子"与"看起来的样子"之间的差距,这一差距有助于我们理解导致某物看起来的样子的心理加工。幻象在探讨人工系统时也很有用,许多研究都考察了计算感知模型是否落入与人类相同的幻象之陷。本文颠倒了感知幻象的标准用途,以考察当前视觉语言模型中的基本处理错误。我向这些模型呈现幻象-幻象,这些是常见幻象的邻居,本应不会引发处理错误。这些包括如完美合理的鸭子、弯曲的直线(这条线确实是弯曲的)、看起来大小不同的圆(它们实际上大小不同)等。我展示了许多当前的视觉语言系统误将这些幻象-幻象视为幻象。我认为,这些失败是更广泛的已在文献中讨论过的失败的组成部分。
引用
@article{arxiv.2412.18613,
title = {The Illusion-Illusion: Vision Language Models See Illusions Where There are None},
author = {Tomer Ullman},
journal= {arXiv preprint arXiv:2412.18613},
year = {2024}
}
备注
9 pages, 5 figures