被画谜难倒:当视觉语言模型无法领会暗示时
计算与语言
2025-09-18 v2 人工智能
计算机视觉与模式识别
机器学习
摘要
画谜是一种通过图像、空间排列和符号替换来编码语言的视觉谜题,对当前的视觉语言模型(VLMs)构成了独特的挑战。与传统的图像描述或问答任务不同,解画谜需要多模态抽象、符号推理以及对文化、语音和语言双关语的掌握。在本文中,我们通过构建一个手工生成并标注的、包含多种英语画谜的基准测试集(从简单的象形符号替换到依赖空间线索的谜题,如“head”在“heels”上方),研究了当代 VLMs 解释和解答画谜的能力。我们分析了不同 VLMs 的表现,研究结果表明,尽管 VLMs 在解码简单的视觉线索方面展现出令人惊讶的能力,但它们在需要抽象推理、横向思维和理解视觉隐喻的任务上仍然面临巨大困难。
引用
@article{arxiv.2505.23759,
title = {Puzzled by Puzzles: When Vision-Language Models Can't Take a Hint},
author = {Heekyung Lee and Jiaxin Ge and Tsung-Han Wu and Minwoo Kang and Trevor Darrell and David M. Chan},
journal= {arXiv preprint arXiv:2505.23759},
year = {2025}
}
备注
EMNLP 2025 Main Conference