Bongard in Wonderland:仍令AI发狂的视觉谜题
人工智能
2025-07-15 v4 机器学习
摘要
最近,新发展的视觉语言模型(VLMs),如OpenAI的o1,已显示出在文本和图像模态之间展现出高级推理能力的迹象。然而,这些进步在语言引导的感知和抽象推理方面的深度仍未得到充分探索,是否能够真正实现其宏伟承诺尚不清楚。为评估进展并识别不足之处,我们进入Bongard问题的奇幻世界,这是一组需要人类类似能力的视觉推理谜题,涉及模式识别和抽象推理。通过我们的广泛评估设置,我们表明尽管VLMs偶尔成功识别判别性概念并解决一些问题,但它们经常会失败。令人惊讶的是,即使是看似对人类而言微不足道的基本概念,如简单螺旋,也会给VLMs带来重大挑战。此外,当被明确要求识别真实概念时,VLMs仍会失败,这表明它们不仅缺乏对这些基本视觉概念的理解,还无法对未见概念进行泛化。我们将VLMs的结果与人类表现进行比较,发现人类视觉推理能力与机器认知之间仍存在显着差距。
引用
@article{arxiv.2410.19546,
title = {Bongard in Wonderland: Visual Puzzles that Still Make AI Go Mad?},
author = {Antonia Wüst and Tim Woydt and Lukas Helff and Inga Ibs and Wolfgang Stammer and Devendra S. Dhami and Constantin A. Rothkopf and Kristian Kersting},
journal= {arXiv preprint arXiv:2410.19546},
year = {2025}
}